L’actualité du jour apporte un éclairage intéressant sur l’évolution du domaine.
SpaceXAI lance Grok 4.5, un modèle entraîné à l’aide du curseur pour la programmation, les tâches agentiques et le travail intellectuel, à un coût de 2 $ par million d’entrées
SpaceXAI vient de lancer Grok 4.5. L’entreprise le présente comme son système le plus intelligent à ce jour. Il est destiné au codage, aux tâches de type « agent » et au travail intellectuel. SpaceXAI précise que Grok 4.5 a été entraîné en parallèle avec Cursor, un éditeur de code basé sur l’IA.
De plus, grok 4.5 est un modèle polyvalent optimisé pour les tâches d’ingénierie concrètes. SpaceXAI l’a entraîné sur des ensembles de données couvrant la programmation, les sciences, l’ingénierie et les mathématiques. L’équipe de recherche décrit son raisonnement comme à la fois intelligent et efficace. Il s’est classé n° 1 au benchmark « Legal Agent » de Harvey, ce que SpaceXAI présente comme un atout pour les tâches administratives.
En complément, l’entraînement a été réalisé sur des dizaines de milliers de GPU NVIDIA GB300. SpaceXAI a utilisé des techniques d’entraînement et de stabilisation conçues pour les exécutions à grande échelle. Au-delà du simple volume de tokens, l’équipe s’est attachée au filtrage et à la curation des données. Cela comprenait la déduplication, l’évaluation de la qualité et la sélection axée sur le domaine.
L’équipe SpaceXAI a ensuite étendu l’apprentissage par renforcement en mettant l’accent sur l’intelligence au niveau de chaque token. L’apprentissage par renforcement a porté sur des centaines de milliers de tâches. La plupart concernaient l’ingénierie logicielle en plusieurs étapes et d’autres travaux techniques. L’évaluation combinait des méthodes automatisées et des méthodes basées sur des modèles. La pile technique prend en charge un apprentissage hautement asynchrone. Les déploiements agentiques peuvent durer plusieurs heures, tandis que l’apprentissage se poursuit.
L’équipe de SpaceXAI a publié les résultats obtenus pour quatre tests de performance en programmation. Les chiffres des concurrents proviennent des fiches techniques publiées ou des classements. Selon SpaceXAI, Grok 4.5 surpasse les principaux modèles comparables. Son propre tableau présente des résultats plus mitigés. Fable (max) affiche le meilleur score sur les quatre benchmarks. Grok 4.5 se classe juste derrière sur le Terminal Bench 2.1.
Référence rapide : « pass@1 » ne prend en compte que les réussites dès la première tentative ; le « taux de résolution » correspond à la proportion de tâches résolues.
Difficile à ce stade de prédire tous les impacts de cette annonce.
Dans le même ordre d’idées :
Selon l’information initialement publiée par MarkTechPost : MarkTechPost