Les dernières heures ont apporté leur lot d’informations dans l’écosystème IA.
OpenAI et Broadcom dévoilent une puce d’inférence optimisée pour les modèles de langage à grande échelle (LLM)
OpenAI et Broadcom (NASDAQ : AVGO) ont dévoilé aujourd’hui Jalapeño, le premier processeur d’intelligence d’OpenAI : un accélérateur conçu autour de la vision d’OpenAI pour l’avenir de l’inférence LLM, et le premier accélérateur d’IA au sein d’une plateforme de calcul multigénérationnelle que les deux entreprises développent conjointement afin de rendre l’IA avancée plus rapide, plus fiable et plus accessible à un plus grand nombre de personnes.
Jalapeño a été remis à Sam Altman, PDG d’OpenAI, et à Greg Brockman, président de l’entreprise, par Hock Tan, président-directeur général de Broadcom, et Charlie Kawwas, président de la société, marquant ainsi une étape importante dans la stratégie d’OpenAI visant à développer l’ensemble de la pile technologique sous-jacente à ses modèles et produits.
Un rapport technique détaillé sur ces performances sera présenté dans les prochains mois.
OpenAI a conçu cette puce à partir de zéro en s’appuyant sur sa connaissance approfondie des principes fondamentaux des modèles de langage à grande échelle (LLM), en tenant compte de sa feuille de route en matière de modèles, de noyaux, de systèmes de mise à disposition et des besoins en produits. En collaboration avec ses partenaires Broadcom et Celestica, l’entreprise a contribué à l’industrialisation de la plateforme grâce à la mise en œuvre de la puce, à l’intégration des cartes et des systèmes de rack, à la mise en place d’un réseau haute performance et à la mise en place de systèmes de production évolutifs. Jalapeño a été conçu pour offrir une grande flexibilité et s’adapter à tous les modèles de langage de grande échelle (LLM), en s’appuyant sur les connaissances d’OpenAI concernant les besoins en matière d’inférence des modèles d’IA actuels et futurs dans l’ensemble du secteur. Des échantillons d’ingénierie de la puce Jalapeño exécutent actuellement des charges de travail d’apprentissage automatique en laboratoire à la fréquence et à la puissance cibles de production, notamment GPT-5.3-Codex-Spark.
Bien qu’OpenAI soit encore en train d’évaluer les performances définitives, les premiers tests montrent que Jalapeño offrira un rapport performances/watt nettement supérieur à celui des technologies de pointe actuelles. Un rapport technique détaillé sur ces performances sera présenté dans les prochains mois. Cette architecture réduit les transferts de données et équilibre les ressources de calcul, de mémoire et de réseau afin d’atteindre un taux d’utilisation réel bien plus proche des performances maximales théoriques. Les puces et les technologies réseau de Broadcom, notamment la puce réseau Tomahawk, contribuent à la mise en œuvre de cette plateforme à grande échelle.
De plus, « Le monde s’oriente vers une économie fondée sur la puissance de calcul », a déclaré Greg Brockman, président et cofondateur d’OpenAI. « Jalapeño s’inscrit dans notre stratégie à long terme d’infrastructure full-stack visant à rendre la puissance de calcul plus abondante, ce qui se traduira par une IA plus rapide, plus fiable et plus abordable pour les particuliers et les entreprises, et qui pourra être utilisée pour résoudre des problèmes plus importants. » « En concevant nous-mêmes une plus grande partie de la pile technologique, nous pouvons proposer davantage de solutions intelligentes avec une efficacité accrue et continuer à rendre l’IA de pointe accessible à un public plus large. »
« Jalapeño a été entièrement conçu pour l’inférence des modèles de langage de grande échelle (LLM), en s’appuyant sur les connaissances approfondies issues de notre étroite collaboration avec les scientifiques d’OpenAI », a déclaré Richard Ho, responsable du programme matériel chez OpenAI. « Nous avons optimisé l’architecture en nous concentrant sur les noyaux, la gestion de la mémoire, la mise en réseau et les modèles de service qui revêtent la plus grande importance pour les modèles d’IA de pointe. » « D’après les premiers tests, Jalapeño permettra d’exécuter efficacement nos charges de travail les plus importantes, à un niveau proche des limites théoriques du matériel. »
À ce sujet, « Notre collaboration avec OpenAI témoigne de notre engagement fondamental à développer l’infrastructure physique nécessaire pour la prochaine décennie de l’IA », a déclaré Hock Tan, président-directeur général de Broadcom. « Ce n’est que le début d’une feuille de route s’étendant sur plusieurs générations. En développant conjointement nos puces de pointe directement avec OpenAI, nous permettons le déploiement, dès 2026, de centres de données d’une puissance de l’ordre du gigawatt avec Microsoft et d’autres partenaires. »
Il faut souligner, jalapeño est une architecture conçue entièrement de zéro pour l’inférence des grands modèles de langage (LLM) modernes ; il ne s’agit pas d’un accélérateur polyvalent adapté à partir d’anciennes charges de travail d’IA. Il s’appuie sur les systèmes qu’OpenAI exploite quotidiennement pour ChatGPT, Codex, l’API et ses futurs produits agentiques, tout en étant conçu pour les grands modèles de langage actuels et futurs de l’ensemble du secteur. L’objectif est d’allier la puissance et le débit des meilleurs accélérateurs d’IA actuels à une latence proche de celle des systèmes d’inférence spécialisés les plus rapides, ce qui fait de Jalapeño une outil parfaitement adaptée aux produits LLM interactifs à grande échelle.
Les prochaines semaines permettront d’en mesurer la portée réelle.
Dans le même ordre d’idées :
- Meredith Whittaker, de Signal, tient à ce que vous gardiez à l’esprit que les chatbots basés sur l’IA « ne sont pas vos amis » | TechCrunch
- Une start-up affirme avoir surmonté un obstacle qui freine le progression des modèles de langage de grande envergure (LLM)
- « In the Weights » : votre nouvel logiciel de travaux de recherche de vanité axé sur l’IA | TechCrunch
Tel que rapporté par OpenAI : OpenAI