NVIDIA présente SoL-Pi : des boucles de recherche automatique qui réduisent le trafic de jetons des agents de codage jusqu’à 49 %

Le paysage de l’intelligence artificielle s’enrichit d’une nouveauté significative.

NVIDIA présente SoL-Pi : des boucles de recherche automatique qui réduisent le trafic de jetons des agents de codage jusqu’à 49 %

Les agents de codage fonctionnent désormais pendant des heures, et non plus quelques minutes. Chaque modification, chaque test et chaque lecture de journal est réintégré dans le contexte du modèle. Une équipe de scientifiques de NVIDIA, de la NTU et du MIT a publié SoL-Pi, un ensemble de quatre mécanismes d’efficacité destinés à l’agent de codage open source Picoding. Une IA a découvert ces mécanismes en exécutant des boucles de recherche automatique au niveau de la couche de harnais. Lors de l’évaluation EdgeBench comprenant 51 tâches, SoL-Pi a permis de réduire le trafic de tokens de 44,7 % à 49,0 % par rapport à Pi et de diminuer le coût des appels API d’environ 33 %. Ses scores restent proches de ceux de Pi, tant sur GPT-5.6 Sol que sur Opus 5.

Parallèlement, peut-on le déployer ? Oui. SoL-Pi est disponible sur GitHub sous le nom de NVlabs, sous forme d’extension sous licence MIT fonctionnant sur une version non modifiée de Pi. Il a été testé avec Pi 0.85.1 et Node.js 22.19 ou une version plus récente.

SoL-Pi, quant à lui, réduit le nombre de tokens consommés par une tâche.

À ce sujet, la plupart des travaux visant à améliorer l’efficacité réduisent le coût par token grâce à des noyaux plus rapides, à la quantification ou à des modèles moins coûteux. SoL-Pi, quant à lui, réduit le nombre de tokens consommés par une tâche. Le « harness » est la couche qui gère les appels aux outils, le contexte, les observations et la délégation.

Notons par ailleurs, le réglage manuel d’un harnais est un processus lent, et ses composants sont interdépendants : une correction à un endroit peut entraîner une augmentation des coûts lors des étapes suivantes. Meta-Harness et d’autres systèmes similaires automatisent ce travail. Cependant, une étude récente a montré que les harnais optimisés peuvent présenter un surajustement pour leurs tâches de recherche et n’apporter que des gains marginaux sur des tâches inconnues.

Une IA de travaux de recherche observe les traces d’exécution provenant d’un agent distinct exécutant la version de base de Pi. Elle propose ensuite des modifications du harnais et les teste. La recherche a porté sur :

Chaque recherche constitue une boucle isolée et ponctuelle. Elle suit le cycle de travaux de recherche automatique (« autoresearchcycle »), complété par une étape de mise en œuvre de la boucle Ralph et par l’intervention d’un évaluateur indépendant.

Les règles d’acceptation sont définies avant le début de la recherche, et l’optimiseur ne peut pas les modifier. Chaque indicateur de performance doit rester dans les limites d’une tolérance prédéfinie. Le candidat doit également améliorer au moins un indicateur d’efficacité. EdgeBench est mis de côté. Sur ses 51 tâches publiques, 11 servent à l’acceptation unidirectionnelle de candidats figés et 40 à l’évaluation finale. Les résultats mis de côté ne sont jamais réinjectés dans la recherche.

En synthèse :

  • Elle propose ensuite des modifications du harnais et les teste.
  • Chaque recherche constitue une boucle isolée et ponctuelle.
  • Les résultats mis de côté ne sont jamais réinjectés dans la recherche.

Les acteurs concernés devront s’adapter à ce nouveau contexte.

Pour aller plus loin :


Couverture originale : MarkTechPost : MarkTechPost