Les développements se succèdent à un rythme impressionnant dans l’IA.
IBM lance Granite 4.2 : l’intégration du raisonnement natif et de l’apprentissage par renforcement agentique dans les modèles d’entreprise ouverts
IBM a lancé Granite 4.2, une famille de modèles de langage à raisonnement ouvert disponibles en trois tailles de paramètres : 3 milliards, 8 milliards et 30 milliards. Contrairement aux versions précédentes de Granite, qui étaient des assistants se contentant d’exécuter des instructions, Granite 4.2 s’articule autour du raisonnement explicite. Chaque modèle peut exprimer un raisonnement avant de répondre, et chacun dispose d’un commutateur « réflexion / non-réflexion » ainsi que d’un mode « faible effort » qui consacre un budget de raisonnement limité aux questions simples. Ces modèles sont des transformateurs denses de type « décodeur seul », pré-entraînés à partir de zéro sur environ 15 000 milliards de tokens, puis post-entraînés via une chaîne d’apprentissage par renforcement en plusieurs étapes. Pour les modèles 8B et 30B, cette chaîne comprend un bloc d’apprentissage par renforcement (RL) agentique dans lequel le modèle d’IA apprend à modifier du code, à utiliser un terminal et à effectuer des recherches sur le Web au sein d’environnements sandbox réels. Ces trois modèles sont distribués sous licence Apache 2.0. IBM a par ailleurs publié, parallèlement à ces LLM, deux modèles Granite Speech 5.0 Turbo CTC comportant 470 millions de paramètres.
Oui, les trois modèles linguistiques Granite 4.2 sont distribués sous licence Apache 2.0 ; leur téléchargement, leur ajustement et leur utilisation en production à des fins commerciales ne sont donc soumis à aucune restriction de licence.
Granite 4.2 est un transformateur dense exclusivement basé sur un décodeur, et non une architecture hybride ou de type MoE.
À ce sujet, granite 4.2 est un transformateur dense exclusivement basé sur un décodeur, et non une architecture hybride ou de type MoE. Ses composants principaux sont le « Grouped Query Attention » avec 8 têtes KV, le RoPE avec θ = 10 000 000, les MLP SwiGLU, la norme RMS (ε = 1e-5), des embeddings d’entrée/sortie non liés et une précision bfloat16.
Le modèle d’IA 3B utilise 40 couches avec une taille d’encodage de 2 560. Le modèle 8B utilise 40 couches avec une taille d’encodage de 4 096. Le modèle 30B passe à 64 couches avec une taille cachée du MLP de 32 768. Le tableau d’architecture publié indique une longueur de séquence de 131 072 tokens (128 K), tandis que le pré-entraînement en cinq phases comprend une phase à long contexte s’étendant jusqu’à 512 K tokens. Le pré-entraînement couvre environ 15 000 milliards de tokens à partir de zéro.
Le réglage fin supervisé utilise environ 7,2 millions d’échantillons, soit environ 100 milliards de tokens, dont environ 65 milliards sont entraînables. La répartition est de 31,6 % d’agents et 68,4 % de non-agents, et l’ingénierie logicielle représente 69 % de la part des agents. Les trajectoires ont été générées à partir de différents harnais, notamment OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex et Goose. Le contrôle qualité a utilisé les outils GPT-OSS-120B et Gemma 4 comme critères d’évaluation, par conséquent qu’une déduplication SHA-256 sur les champs « tools » et « messages ».
L’apprentissage post-formation est une chaîne RL en plusieurs étapes et dans de multiples environnements, et non un simple passage unique. Chaque étape correspond à une exécution GPO asynchrone distincte qui démarre à chaud à partir du point de contrôle précédent, avec une base de référence « leave-one-out » à la place d’un réseau de valeurs et un échantillonnage d’importance tronqué pour limiter la dérive hors politique. L’ordre est le suivant : RLVR, puis les « skill boosters », puis SWE, Terminal, Search, puis RLHF.
Le bloc RL « Theagentic » ne fonctionne que sur les modèles 8B et 30B. Le modèle 3B ne prend en charge que le RL de base et l’alignement. Ce simple choix de conception explique en grande partie l’écart de performances entre les différentes tailles. L’entraînement a été effectué sur NeMo-RL et NeMo-Gym via un cluster NVIDIA GB200 NVL72 hébergé par CoreWeave.
Deux éléments clés entrent en jeu : 1 000 milliards de tokens de code synthétique issus du pipeline CodeAlchemy d’IBM, et une couche de décodage spéculative permettant une diffusion plus rapide.
Les éléments clés de cette information :
- L’ordre est le suivant : RLVR, puis les « skill boosters », puis SWE, Terminal, Search, puis RLHF.
- L’entraînement a été effectué sur NeMo-RL et NeMo-Gym via un cluster NVIDIA GB200 NVL72 hébergé par CoreWeave.
L’avenir dira si cette annonce tient toutes ses promesses.
À découvrir aussi :
- La start-up de robotique Generalist atteindrait une valorisation de 3 milliards de dollars, selon certaines sources | TechCrunch
- Liquid AI open-source « Pipette » : une suite d’évaluations reproductibles qui mesure simultanément les modèles embarqués, la quantification, le temps d’exécution et le matériel
Lire l’article original sur MarkTechPost : MarkTechPost