Comment l’activation de deux paramètres a permis de tripler nos scores au benchmark ARC-AGI-3

Le paysage de l’intelligence artificielle s’enrichit d’une nouveauté significative.

Comment l’activation de deux paramètres a permis de tripler nos scores au benchmark ARC-AGI-3

Une vidéo accélérée montrant GPT-5.6 Sol en train de tenter de résoudre des énigmes du benchmark ARC-AGI-3, avec le harnais officiel (à gauche) et notre harnais Responses API (à droite), qui conserve le raisonnement et permet la compression. Dans le classement de ce jeu⁠(s’ouvre dans une nouvelle fenêtre), aucun modèle de pointe ne parvient à résoudre de niveau au-delà du premier. Avec notre interface, GPT-5.6 Sol résout les six niveaux.

Lorsque nous avons découvert pour la première fois les faibles retombées obtenus par GPT-5.6 Sol au test de performance ARC-AGI-3⁠(s’ouvre dans une nouvelle fenêtre), nous avons été perplexes.

ARC-AGI-3 est un test de référence conçu pour évaluer la capacité d’apprentissage et de raisonnement des agents d’IA.

Dans le même temps, gPT-5.6 Sol a résolu des problèmes mathématiques non résolus de longue date, comme la conjecture du double recouvrement des cycles⁠(s’ouvre dans une récente fenêtre), et a remporté des jeux tels que Pokémon Rouge Feu. Mais sur ARC-AGI-3, un benchmark dédié aux jeux de réflexion en 2D, GPT-5.6 Sol n’a obtenu que 7,8 %, tandis que GPT-5.5 a à peine réussi à jouer à ces jeux, avec un maigre score de 0,4 %.

Les jeux de réflexion en 2D étaient-ils particulièrement difficiles pour nos modèles ? Ou y avait-il une autre explication ?

Les tests de performance évaluent rarement les modèles d’IA de manière isolée. Ils prennent en outre en compte des choix moins visibles concernant les paramètres de l’API, la conception des harnais et les prompts. Dans le cas d’ARC-AGI-3, nous avons découvert que l’activation de deux paramètres de l’API que nous utilisons dans ChatGPT et Codex — le « retained reasoning » et la « compaction » — a triplé les scores et réduit de six fois le nombre de tokens de sortie sur l’ensemble de tâches public.

Autre élément, avec le harnais officiel, GPT-5.6 Sol a obtenu un score de 13,3 % sur l’ensemble de données public ARC-AGI-3. En intégrant le raisonnement et la compression, il a atteint un score de 38,3 %. Ces scores mesurent l’efficacité relative par rapport à l’action humaine (RHAE⁠(s’ouvre dans une nouvelle fenêtre)), un indicateur qui compare les performances du modèle d’IA à celles d’un humain de référence. D’après les journaux de jeu officiels⁠(s’ouvre dans une dernière fenêtre), nous estimons que le score moyen des testeurs humains s’élevait à 48 %. Les modèles ne sont pas informés de la manière dont ils seront notés et ne peuvent pas consulter leur score à aucun moment : les actions ne renvoient qu’une représentation textuelle de chaque image et le niveau auquel elles se situent.

ARC-AGI-3 est un test de référence conçu pour évaluer la capacité d’apprentissage et de raisonnement des agents d’IA. Ces agents explorent des jeux en 2D qui leur sont inconnus et en déduisent le fonctionnement sans instructions explicites. Vous pouvez jouer à 25 jeux de démonstration sur arcprize.org/tasks⁠(s’ouvre dans une nouvelle fenêtre).

ARC-AGI-3 utilise un harnais volontairement générique, sans outils ni fonctionnalités spécifiques. ARC a justifié ce choix en expliquant qu’un harnais simple met davantage en évidence les lacunes des modèles et rend les comparaisons entre eux plus équitables. Les développeurs commerciaux, en revanche, optimisent leurs harnais en fonction des caractéristiques et des particularités de chaque modèle.

Il faudra attendre les retours concrets pour juger de l’impact réel.

À lire également :


Lire l’article complet sur OpenAI : OpenAI