La pile complète à l’origine d’une intelligence abondante

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours.

La pile complète à l’origine d’une intelligence abondante

Les progrès en matière d’IA s’accélèrent lorsque l’ensemble du système évolue de manière concertée. C’est ainsi que je conçois la stratégie informatique d’OpenAI : un système intégré englobant les centres de données et les puces, les modèles de pointe, notre plateforme pour développeuses et développeurs, nos produits destinés aux particuliers et aux entreprises, ainsi que les appareils nativement équipés d’IA, chaque couche venant renforcer la suivante.

De meilleurs logiciels permettent au matériel d’être plus productif. Un matériel conçu pour nos charges de travail fait progresser la vitesse et l’efficacité. Des modèles plus performants permettent de créer de meilleurs produits, qui génèrent davantage de demande, d’utilisation et d’apprentissage. Ces signaux sont réinjectés dans le mécanisme et nous aident à l’améliorer encore davantage.

Un matériel conçu pour nos charges de travail fait progresser la vitesse et l’efficacité.

Aujourd’hui, nous avons publié les premiers retombées de performances mesurés de Jalapeño, la première puce d’inférence sur mesure d’OpenAI. Sur InferenceX, un benchmark public utilisant GPT-OSS 120B, Jalapeño a affiché un débit de pointe par kilowatt supérieur et une latence par token inférieure à celles des systèmes commerciaux pris en compte dans la comparaison. Il a en outre affiché d’excellentes performances sur DeepSeek R1 et Kimi K2, démontrant ainsi que ses progrès s’étendent à l’ensemble des familles de modèles.

Jalapeño nous permet de mieux contrôler le fonctionnement de nos modèles ainsi que les aspects économiques liés à leur mise en service. En développant conjointement le modèle d’IA, le logiciel de mise en service, le processeur, la mémoire et le réseau, nous pouvons faire progresser le débit, la latence, l’efficacité énergétique et les coûts au sein d’un système unique. Cela nous offre la possibilité de mettre en place une solution propriétaire fiable, parallèlement aux accélérateurs fournis par d’autres partenaires, ce qui renforce notre capacité à affecter chaque charge de travail au dispositif le plus performant, tout en garantissant une rentabilité optimale. Nous disposons désormais de puces propriétaires opérationnelles dont les performances ont été mesurées, et les prochaines générations sont déjà en cours de progression.

Les différentes charges de travail imposent des contraintes différentes au système. L’entraînement Frontier, l’inférence à haut débit et les agents fonctionnant en permanence ont des exigences distinctes en matière de puces, de logiciels, de réseaux, d’alimentation et de latence.

Notre objectif est de rester sur la frontière de Pareto : rechercher en permanence la combinaison optimale de performances, de rapidité, de fiabilité, d’efficacité et de coût pour chaque charge de travail. Selon les puces et les fournisseurs, ce sont des aspects différents qui priment, et la frontière ne cesse d’évoluer.

Les acteurs concernés devront s’adapter à ce nouveau contexte.

Dans le même ordre d’idées :


Information publiée en premier lieu par OpenAI : OpenAI