Présentation de GPT-6.1 Sol

Voici une annonce qui mérite l’attention des observateurs du secteur.

Présentation de GPT-6.1 Sol

Nous vous présentons GPT-6.1 Sol, une version améliorée de GPT-6 Sol qui égale presque l’intelligence de GPT-6 Astra en matière de codage agentique, d’utilisation de l’informatique et de travail professionnel, à un cinquième des tarifs standard d’Astra pour les jetons d’entrée et de sortie. Le coût des entrées mises en cache n’est que de 0,10 $ par million de jetons, soit 95 % de moins que le tarif standard des entrées et 50 % de moins que celui des entrées mises en cache de GPT-6 Sol, ce qui offre aux développeurs davantage de marge de manœuvre pour créer et exploiter des agents performants capables de réutiliser le contexte d’une requête à l’autre.

GPT-6.1 Sol offre un nouvel équilibre entre performances et coût pour les tâches quotidiennes essentielles. Il apporte des améliorations substantielles par rapport à GPT-6 Sol dans le cadre de tâches professionnelles complexes, allant de l’écriture et du débogage de code à la compréhension de documents et à l’exécution de workflows métier en plusieurs étapes. Dans de multiples de ces évaluations, il se rapproche des retombées de GPT-6 Astra à un coût nettement inférieur.

Il se rapproche également des retombées de pointe de GPT-6 Astra, pour un coût par tâche représentant environ un cinquième de celui-ci.

Précisons, onDeepSWE v1.1, qui évalue des tâches complexes d’ingénierie logicielle sur des bases de code réelles, GPT-6.1 Sol égale les retombées de GPT‑6 Astra pour un coût représentant environ un cinquième de celui-ci, tout en surpassant le meilleur score de GPT‑6 Sol de 6,4 points de pourcentage, avec un effort de raisonnement et un coût moindres.

Dans InDeepSWE 1.1⁠⁠(s’ouvre dans une nouvelle fenêtre), des agents IA résolvent des tâches originales d’ingénierie logicielle à long terme.

Dans le test OnGDP.pdf, qui évalue la précision avec laquelle les modèles répondent à des questions spécialisées à partir de documents PDF complexes comportant des tableaux, des graphiques, des schémas et des détails en petits caractères, GPT-6.1 Sol obtient de meilleurs performances qu’Opus 5.5, avec des solutions de repli, pour un coût par tâche inférieur de plus de moitié dans tous les scénarios de raisonnement testés. Il se rapproche également des retombées de pointe de GPT-6 Astra, pour un coût par tâche représentant environ un cinquième de celui-ci.

Dans le fichier InGDP.pdf⁠(s’ouvre dans une nouvelle fenêtre), les modèles doivent répondre à des questions concrètes portant sur des fichiers PDF complexes issus de flux de travail professionnels dans les secteurs de la finance, de la santé, du droit et de sept autres domaines professionnels.

Sur AutomationBench, qui évalue la capacité des agents à mener à bien des flux de travail métier en divers étapes, le GPT-6.1 Sol obtient un score supérieur de 2,2 points de pourcentage à celui de l’Opus 5.5 pour un effort de raisonnement moyen, et ce pour un coût représentant environ un tiers de celui-ci. Ce score est également en hausse de 4,8 points de pourcentage par rapport à celui du GPT-6 Sol dans les mêmes conditions.

Ce développement s’ajoute à une longue série d’évolutions dans le secteur.

Pour aller plus loin :


Lire l’article complet sur OpenAI : OpenAI