SpaceXAI lance Grok 4.6 : un système de pointe capable de traiter des contextes de 500 000, optimisé pour les agents à exécution longue, la programmation et les tâches intellectuelles

Voici une information qui pourrait bien avoir un impact durable sur le secteur.

SpaceXAI lance Grok 4.6 : un système de pointe capable de traiter des contextes de 500 000, optimisé pour les agents à exécution longue, la programmation et les tâches intellectuelles

SpaceXAI vient de publier Grok 4.6. Il s’agit d’une mise à jour post-entraînement par rapport à Grok 4.5, et non d’un nouveau modèle de base plus complet. SpaceXAI a conservé la base inchangée et a consacré ses efforts à un cycle d’entraînement complémentaire plus long, à la régénération de trajectoires de réglage fin supervisées et à l’apprentissage par renforcement dans des environnements agentiques. Des agents qui restent concentrés sur une tâche tout au long de nombreuses étapes sans s’écarter de leur objectif. Grok 4.6 obtient un score de 61 à l’indice d’intelligence artificielle d’analyse, soit une hausse de cinq points par rapport à Grok 4.5, et se place à égalité avec GPT-5.6 Sol Max. Ce modèle d’IA traite 500 000 tokens de contexte, est disponible dès aujourd’hui sur inCursor et Grok Build, et ajoute un nouveau niveau de « xhighreasoning-effort » au-dessus de l’échelle fournie avec Grok 4.5.

Oui, en production, avec un ensemble limité de charges de travail. Le modèle est disponible pour tous via l’API xAI sous le nom de « grok-4.6 » ; il s’agit du modèle par défaut dans Grok Build, il est inclus dans Cursor pour toutes les formules d’abonnement, et il peut être acheminé via OpenRouter, Vercel et Cloudflare. Il n’existe ni version en accès libre ni option d’auto-hébergement ; les déploiements en « air-gap » sont donc impossibles.

Grok 4.6 n’est pas une version plus volumineuse du modèle de base. SpaceXAI explique qu’il s’agit d’un cycle d’entraînement complémentaire plus long que celui dont a bénéficié Grok 4.5, utilisant des données sélectionnées générées par le modèle pour le raisonnement et les concepts techniques avancés, des données d’ingénierie de haute qualité, ainsi qu’un optimiseur et une méthode d’entraînement améliorés.

Grok 4.5 a ensuite été utilisé pour régénérer des trajectoires d’ajustement supervisé à différents niveaux d’effort de raisonnement, avec différents harnais d’agents et dans des champs d’application couvrant les sciences, les technologies, l’ingénierie et les mathématiques (STEM), le génie logiciel et le travail intellectuel, les traces problématiques ayant été filtrées par des contrôles basés sur des modèles. L’apprentissage par renforcement a ensuite été appliqué à des environnements agentiques couvrant le travail intellectuel, la programmation générale, le développement web, la conception assistée par ordinateur et l’optimisation des noyaux.

En parallèle, cette observation comportementale est importante : sur des trajectoires plus longues, SpaceXAI fait état d’un recours accru aux autotests et à la vérification, le système vérifiant son propre travail avant de passer à l’étape suivante. Il s’agit là d’une observation formulée par le fournisseur à l’issue de tests internes, et non d’un résultat mesuré de manière indépendante.

En parallèle, le système traite 500 000 jetons de contexte, accepte des entrées sous forme de texte et d’images avec une sortie exclusivement textuelle, ne présente aucune limite déclarée en termes de longueur de sortie textuelle et dispose d’une date de coupure des connaissances fixée au 1er février 2026. L’option `reasoning_effort` prend désormais en charge les niveaux « slow », « medium », « high » (par défaut) et un nouveau niveau « xhigh ». SpaceXAI n’a pas publié le nombre de paramètres de Grok 4.6.

Dans le classement de mise en service de xAI, Grok 4.6 (High) obtient un score de 61 à l’indice d’intelligence d’analyse artificielle (Artificial Analysis Intelligence Index), en hausse par rapport au score de 56 de Grok 4.5 et à égalité avec GPT-5.6 Sol Max. Il arrive en tête du classement sur GDPval-AA v2 (1 753 Elo, contre 1 526 pour Grok 4.5), AA-Briefcase (1 577, contre 1 313) et Harvey LAB.

Il reste à la traîne sur les lignes de code qui comptent le plus pour les équipes d’ingénieurs. DeepSWE v1.1 affiche un score de 65,9 %, soit une hausse de 11,9 points par rapport à la génération précédente, mais reste derrière GPT-5.6 Sol Max, qui atteint 73 %. Terminal-Bench v3.0 atteint 26 %, soit près du double des 15,7 % de Grok 4.5, mais reste dernier des quatre modèles cités. CursorBench v3.2 affiche 69,9 %, FrontierCode v1.1 Extended 61,3 % et APEX-Agents 57,5 %.

L’avenir dira si cette annonce tient toutes ses promesses.

Sur le même sujet :


Source originale : MarkTechPost : MarkTechPost