Un nouveau jalon vient d’être franchi dans l’univers de l’intelligence artificielle.
Cisco AI présente FAPO : optimisation des prompts tenant compte du pipeline, avec attribution des échecs au niveau des étapes et orchestration du code Claude
Réussir à formuler correctement les prompts reste la partie la plus difficile lorsqu’il s’agit de déployer des applications LLM fiables. De légères modifications dans la formulation peuvent faire varier la précision de 20 %. Ce qui fonctionne sur quelques exemples ne fonctionne souvent plus à grande échelle. Lorsqu’un pipeline en plusieurs étapes renvoie une réponse erronée, identifier l’étape défaillante nécessite d’inspecter manuellement les performances intermédiaires.
Fait intéressant, cisco AI a lancé FAPO pour remédier à ce goulot d’étranglement. FAPO signifie « Fully Automated Prompt Optimization » (optimisation entièrement automatisée des invites). Il s’agit d’un système basé sur Claude Code qui optimise les pipelines de modèles de langage à grande échelle (LLM), depuis les invites de référence jusqu’à la précision visée. Il vous suffit de fournir un ensemble de données et une invite initiale. FAPO évalue ensuite les défaillances, les classe, propose des variantes, les valide, puis répète le processus. L’ensemble de ce cycle est orchestré par des agents Claude Code. Le projet est distribué en open source sous licence Apache 2.0 et prend en outre en charge Codex en tant qu’agent d’optimisation.
FAPO signifie « Fully Automated Prompt Optimization » (optimisation entièrement automatisée des invites).
Selon l’évaluation publiée par Cisco, FAPO a surpassé GEPA, un optimiseur de prompt de pointe, dans 15 des 18 comparaisons de modèles de référence. Sur les deux tests de référence où FAPO a nécessité des modifications du pipeline, le gain moyen par rapport à GEPA a atteint +33,8 points de pourcentage.
Parallèlement, fAPO est un cadre d’évaluation et d’optimisation multi-locataires. Un « locataire » correspond à un projet d’optimisation autonome. Chaque répertoire de locataire contient les invites, l’ensemble de données, la définition de la chaîne, le dispositif d’évaluation et la configuration d’une tâche. Les locataires restent isolés les uns des autres, ce qui permet à des tâches sans rapport entre elles d’être optimisées en parallèle sans interférence.
Le moteur principal, baptisé « hephaestus », est indépendant du domaine. Il gère l’évaluation, l’exécution des chaînes et le calcul des scores. Les chaînes sont des graphes de type LangGraphState qui traitent chaque cas de test. Par défaut, FAPO prend en charge trois fournisseurs : OpenAI, Baseten et SageMaker.
La seule donnée que vous devez fournir est un ensemble de éléments. Ce sont les paires d’entrées et de sorties attendues qui déterminent la réussite. FAPO le divise en un ensemble de validation et un ensemble de test mis de côté. L’ensemble de validation pilote les itérations ; l’ensemble de test n’est utilisé que pour une évaluation finale en une seule fois. À partir d’une description de la tâche, Claude peut structurer le reste : la consigne initiale, la chaîne et le système de notation.
Les acteurs concernés devront s’adapter à ce nouveau contexte.
À lire également :
- Amazon MGM a abandonné le projet de film consacré à Sam Altman
- Perplexity lance « Brain », un système de mémoire capable de s’faire progresser de lui-même, qui construit un graphe contextuel du travail d’un agent et apprend pendant la nuit
- Bernie Sanders dévoile un plan de 7 000 milliards de dollars visant à donner aux Américains le contrôle du secteur de l’IA
Via MarkTechPost : MarkTechPost