Les dernières heures ont apporté leur lot d’informations dans l’écosystème IA.
Comment nous avons mis au point en six mois un système en temps réel pour une IA vocale réactive
Par Justin Uberti et Zahan Malkani, membres du personnel technique
En matière d’IA vocale, savoir quand prendre la parole est plus difficile qu’il n’y paraît. Les locuteurs humains se relaient sans effort en une fraction de seconde, cependant les anciens systèmes d’IA vocale ne parvenaient pas à suivre ce rythme. Leur architecture au tour par tour s’appuyait sur de minuscules modèles appelés « détecteurs de tour », qui devaient faire face à une tâche peu enviable : s’ils devinaient trop tôt, l’utilisateur était interrompu ; s’ils devinaient trop tard, la réponse semblait lente. Ce n’est qu’une fois que le détecteur avait pris sa décision que le LLM, bien plus volumineux, pouvait se mettre au travail.
Dans le même temps, gPT‑Live, notre dispositif vocal de troisième génération, supprime le détecteur de tour de parole du chemin audio. Son modèle vocal est en duplex intégral, ce qui signifie qu’il peut écouter et parler en même temps. Cela évite d’avoir recours à un détecteur distinct et rend la conversation plus immédiate et plus naturelle. Lorsqu’un raisonnement plus approfondi ou l’utilisation d’outils s’avère nécessaire, GPT-Live peut aussi faire appel à nos modèles de pointe, tels que GPT-5.5, sans interrompre le fil de la conversation. Ensemble, ces capacités confèrent à GPT-Live une combinaison sans précédent de réactivité conversationnelle et d’intelligence.
De plus, pour offrir cette expérience à grande échelle, il a fallu mettre en place une dernière architecture système optimisée pour une faible latence. Contrairement aux processus d’inférence classiques de type « requête-réponse », notre mécanisme transmet en continu le flux audio entrant vers le modèle vocal et renvoie la parole générée à l’utilisateur, tout en gérant la délégation via un chemin asynchrone distinct. Au cours des six derniers mois, nous avons repensé l’inférence du modèle, la gestion du contexte et le transport des données multimédias afin d’assurer un flux vocal fluide de bout en bout.
Cette architecture établit également une séparation claire entre le chemin vocal principal et la logique métier. Cela permet de personnaliser facilement le comportement de l’application sans nuire à sa réactivité. Cette base technique permet de développer un éventail croissant de fonctionnalités dans ChatGPT Voice, notamment la récente fonctionnalité permettant de contrôler votre ordinateur et de coordonner vos agents dans l’application de bureau ChatGPT.
Dans cet article, nous expliquerons pourquoi les anciens systèmes au tour par tour ne répondaient pas à nos besoins et comment nous avons conçu ce nouveau système pour garantir une réactivité à tous les niveaux. Nous aborderons l’inférence avec état, la gestion dynamique du contexte, la délégation asynchrone et l’optimisation au niveau du protocole, autant d’éléments qui, combinés, confèrent à GPT-Live une véritable sensation de « temps réel ».
Les premières architectures vocales reprenaient le principe des tours de parole propre aux grands modèles de langage (LLM) textuels, mais chaque tour était représenté par un bloc audio distinct plutôt que par du texte. Dans les systèmes en cascade, la conversion parole-texte, le LLM et la conversion texte-parole s’exécutaient chacun à la suite. Cet enchaînement a accru la latence et n’a pas tenu compte d’indices tels que le ton et le rythme.
Les acteurs concernés devront s’adapter à ce nouveau contexte.
À découvrir aussi :
Via OpenAI : OpenAI