Un développement récent dans le monde de l’IA attire l’attention.
Thinking Machines Lab lance Inkling : un modèle MoE multimodal à poids ouverts comportant 975 milliards de paramètres, dont 41 milliards de paramètres actifs, et dont l’effort de réflexion est contrôlable
Thinking Machines Lab vient de lancer Inkling, son premier système entraîné à partir de zéro, dont les paramètres sont ouverts et peuvent être affinés sur Tinker. Le laboratoire le présente comme une base à personnaliser.
Inkling est un transformateur de type « Mixture-of-Experts » comptant 975 milliards de paramètres au total, dont 41 milliards actifs. Il prend en charge une fenêtre de contexte pouvant atteindre 1 million de tokens. L’entraînement préalable a porté sur 45 000 milliards de tokens issus de textes, d’images, de fichiers audio et de vidéos. Les entrées acceptent du texte, des images et de l’audio ; la sortie est exclusivement du texte au format UTF-8.
À noter également, l’équipe de recherche a également présenté en avant-première Inkling-Small, un système MoE comptant 276 milliards de paramètres, dont 12 milliards de paramètres actifs. Il égale, voire surpasse, son homologue plus imposant sur de nombreux benchmarks, et ses poids seront disponibles dès la fin des tests. La personnalisation et le réglage fin constituant le principal facteur de différenciation, l’architecture revêt ici une importance capitale.
Fait intéressant, l’architecture du modèle comprend un transformateur à 66 couches de décodage uniquement, doté d’une structure principale de type « feed-forward » avec des poids MoE clairsemés. Chaque couche MoE contient 256 experts routés ainsi que 2 experts partagés. Six experts routés s’activent par token, tandis que les deux experts partagés s’activent à chaque token. Un routeur basé sur une fonction sigmoïde gère la sélection, en utilisant un biais d’équilibrage de charge auxiliaire sans perte. Les scores acheminés et partagés sont normalisés conjointement, puis utilisés pour pondérer les sorties combinées. La conception du MoE s’inspire largement de celle de DeepSeek-V3.
Le modèle « Attention » s’écarte des conventions. Les couches à fenêtre glissante et les couches globales s’entremêlent selon un rapport de 5:1 avec des têtes de 8 kV. Pour la position, on utilise un encodage positionnel relatif plutôt que RoPE, ce qui, selon les rapports du laboratoire, permet une meilleure extrapolation. Des convolutions courtes sont appliquées après les projections de clés et de valeurs, de ce fait que sur les sorties de la branche résiduelle.
La multimodalité ne fait pas appel à d’encodeur. Les données audio sont introduites sous forme de spectrogrammes dMel, tandis que les images sont converties en fragments de 40 × 40 pixels via un hMLP à quatre couches. Une couche d’intégration légère projette ces deux types de données, puis le décodeur les traite conjointement avec les tokens de texte.
L’entraînement a utilisé Muon pour les poids matriciels volumineux et Adam pour les autres paramètres, sur des systèmes NVIDIA GB300 NVL72. Après l’entraînement, un bootstrap a été effectué à partir de SFT sur des éléments synthétiques, y compris des données générées par Kimi K2.5. La majeure partie du calcul a été consacrée à l’apprentissage par renforcement asynchrone, qui a dépassé les 30 millions de rollouts, avec une amélioration log-linéaire tout au long du processus. Cette exécution d’apprentissage par renforcement a par ailleurs permis de générer la surface de contrôle principale du modèle.
Au cours de l’apprentissage par renforcement (RL), l’équipe de recherche a défini l’effort en modifiant le message du système et en ajustant le coût par jeton. Le modèle a ainsi appris à répartir différemment les budgets de jetons selon les différents rollouts. La version publiée offre la possibilité de faire varier l’effort de 0,2 à 0,99, et les développeurs peuvent le définir directement. Dans Intransformers, ce même contrôle est accessible sous la forme d’un argument `reasoning_effort` avec des niveaux nommés.
Reste à voir comment l’industrie va réagir à cette annonce.
À découvrir aussi :
- Guide de programmation pour la programmation GPU par tuiles de NVIDIA : de cuTile et des noyaux Triton à Flash Attention
- Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d’une IA centrée sur l’humain, reposant sur des poids de modèles personnalisables
- SpaceXAI lance Grok 4.5, un modèle entraîné à l’aide du curseur pour la programmation, les tâches agentiques et le travail intellectuel, à un coût de 2 $ par million d’entrées
Selon l’information initialement publiée par MarkTechPost : MarkTechPost