Les développements se succèdent à un rythme impressionnant dans l’IA.
Les premiers résultats de Jalapeño démontrent une vitesse et une efficacité de pointe dans le domaine de l’inférence IA
Depuis l’annonce de Jalapeño, la première puce d’inférence sur mesure d’OpenAI, nous avons testé cette puce ainsi que le système conçu autour d’elle. Les résultats montrent une amélioration significative des performances : Jalapeño autorise de traiter davantage de tâches d’IA par unité d’énergie, tout en fournissant des réponses plus rapidement. Jalapeño offre à la fois un débit plus élevé et une latence plus faible grâce à une architecture unique, alors que les systèmes matériels existants doivent souvent faire un compromis entre ces deux critères.
Pour les clients, cela peut se traduire par des réponses plus rapides, des agents plus réactifs et un accès plus fiable à mesure que la demande augmente. Notre mission est de veiller à ce que l’intelligence artificielle générale profite à l’ensemble de l’humanité. Ces avancées contribueront à rendre l’IA, dont les capacités ne cessent de s’améliorer, plus abordable et plus largement accessible.
À relever, les modèles d’OpenAI ont également permis d’accélérer le développement de Jalapeño. Les générations précédentes ont aidé l’équipe à concevoir et à mettre au point la puce, tandis que nos derniers modèles accélèrent désormais son optimisation et sa programmation. Les performances de Jalapeño s’étendent aux modèles GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T, démontrant ainsi que l’architecture fonctionne avec des modèles développés aussi bien au sein d’OpenAI qu’à l’extérieur. Sur ces trois modèles, Jalapeño a fourni 1,5 à 1,9 fois plus de travail d’IA par watt au débit maximal et une latence de bout en bout 1,7 à 3,6 fois inférieure à celle des systèmes de référence. Pour les charges de travail hautement interactives, il a offert des performances de 2,1 à 4,1 fois supérieures.
Jalapeño illustre aussi un avantage plus large lié à une approche « full-stack ». OpenAI est en mesure de concevoir conjointement des modèles, des produits, des logiciels de mise à disposition, des puces, de la mémoire, des réseaux et des systèmes, en s’appuyant sur les enseignements tirés de charges de travail réelles pour améliorer chaque couche de la pile. Jalapeño utilise des puces développées en interne avec des performances mesurables, et marque le début d’une plateforme multigénérationnelle. Au cours des prochains mois, nous allons accélérer le avancée de Jalapeño afin de proposer à nos clients des produits plus rapides, plus performants et plus efficaces.
À relever, nous évaluons les performances dans des conditions d’expérience utilisateur comparables, en mesurant la quantité de travail utile que chaque mécanisme peut accomplir grâce à l’IA par unité de puissance, tout en respectant les exigences de latence des clients et des agents interactifs. Cela revêt une importance particulière pour les agents, qui doivent effectuer de nombreuses étapes à la suite les unes des autres, de sorte que les retards peuvent s’accumuler tout au long d’une tâche.
Parallèlement, pour comprendre les performances de Jalapeño en conditions réelles, nous l’avons testé sur InferenceX, un benchmark public développé par SemiAnalysis qui évalue l’ensemble du processus de traitement d’une requête d’IA. Nous avons comparé Jalapeño aux principaux systèmes d’IA disponibles sur le marché sur l’ensemble de la plage de fonctionnement testée, allant du traitement à haut débit à une utilisation hautement interactive et à faible latence. Jalapeño a offert la meilleure combinaison entre débit, efficacité énergétique et latence. Même si les performances sont parfois exprimées par puce, nous estimons que la norme la plus pertinente est celle des performances par unité de puissance.
Les mois à venir apporteront sans doute plus de précisions.
À lire également :
Article original : OpenAI : OpenAI