DeepReinforce lance Ornith-1.0 : une famille de modèles de codage open source capables d’apprendre leurs propres structures d’apprentissage par renforcement

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours.

DeepReinforce lance Ornith-1.0 : une famille de modèles de codage open source capables d’apprendre leurs propres structures d’apprentissage par renforcement

DeepReinforce a lancé Ornith-1.0, une famille de modèles open source conçue pour le codage agentique. La gamme comprend quatre tailles, allant d’un modèle d’IA dense de 9 milliards de paramètres à un système phare de type « mixture-of-experts » de 397 milliards de paramètres. Chaque point de contrôle est disponible sous licence MIT sur Hugging Face. Les modèles ont été entraînés a posteriori à partir des modèles pré-entraînés Gemma 4 et Qwen 3.5.

À relever, la plupart des agents de codage associent un modèle d’IA à un harnais fixe conçu par l’homme. Ornith-1.0, quant à lui, apprend à écrire le sien. L’équipe de travaux de recherche DeepReinforce fait état de retombées à la pointe de la technologie parmi les modèles ouverts de taille comparable.

Tout d’abord, le modèle lit la tâche et son échafaudage précédent.

Ornith-1.0 est un ensemble de modèles de raisonnement optimisés pour les agents de codage. Les variantes disponibles sont 9B Dense, 31B Dense, 35B MoE et 397B MoE. Le modèle 35B est de type « mixture-of-experts » (MoE) et active environ 3 milliards de paramètres par token. Des versions FP8 et GGUF sont également disponibles pour un service local plus rapide.

Chaque modèle est un modèle de raisonnement. Les réponses commencent par un bloc avant la réponse finale. Les recettes de service activent un analyseur de raisonnement, de sorte que la trace soit renvoyée dans un champ « reasoning_content » distinct. Les modèles génèrent également des appels d’outils bien formés pour les boucles d’agents.

Le déploiement est très simple. Le modèle 9B occupe environ 19 Go dans bf16 et s’exécute sur un seul GPU de 80 Go. Les recettes de déploiement ciblent vLLM, SGLang et Transformers. Chaque système expose un point de terminaison compatible avec OpenAI. Les frameworks d’agents standard fonctionnent donc sans modification du code.

La plupart des agents de codage s’appuient sur une structure, en outre appelée « harnais ». Cette structure entoure le système en lui fournissant de la mémoire, des outils, une gestion des erreurs et une logique d’orchestration. Les équipes d’IA conçoivent généralement manuellement une structure par catégorie de tâches.

Ornith-1.0 considère plutôt le « scaffold » comme un objet pouvant être appris. Au cours de l’apprentissage par renforcement, le « scaffold » coévolue avec la politique du modèle. Chaque étape d’apprentissage par renforcement se déroule en deux phases.

D’un autre côté, tout d’abord, le modèle lit la tâche et son échafaudage précédent. Il propose ensuite un échafaudage affiné. Ensuite, il utilise cet échafaudage et la tâche pour générer un déroulement de outil. La récompense issue de ce déroulement est réinjectée dans les deux étapes.

Un dossier qu’il faudra continuer à observer dans les mois à venir.

À découvrir aussi :


Source : MarkTechPost : MarkTechPost