Une évolution notable vient d’être rendue publique dans le domaine.
PolyAI lance Dialog-RSN-1 : un modèle de dialogue natif audio qui intègre la gestion des tours de parole, la reconnaissance vocale, l’appel de fonctions et la réponse
PolyAI a lancé Dialog-RSN-1, un système de dialogue qui perçoit directement le son de l’appelant au lieu de lire une transcription. Il intègre la gestion des tours de parole, la reconnaissance vocale, l’appel de fonctions et la génération de réponses au sein d’un seul modèle d’IA natif audio, et traite déjà des appels en production en direct.
Oui, mais uniquement via PolyAI : pas de paramètres ouverts, pas d’API publique pour l’instant. Les clients existants peuvent l’activer dès aujourd’hui ; les nouveaux clients peuvent demander un accès anticipé.
Deux architectures s’imposent, et chacune fait des concessions. Une pile en cascade ne transmet au LLM que la meilleure estimation de l’ASR ; par conséquent, le ton, les hésitations et l’incertitude liée à la reconnaissance disparaissent avant même que le LLM ne reçoive la moindre information. Le réglage consiste à ajuster manuellement les paramètres de point d’extrémité et le biais de l’ASR, qui sont rarement transposables d’un cas d’utilisation à l’autre. Les modèles de synthèse vocale en temps réel, tels que GPT Realtime et Gemini Live, conservent le flux audio mais intègrent la voix au modèle, ce qui limite le contrôle de la prononciation ; quant aux variantes en duplex intégral fonctionnant en permanence, elles mobilisent un GPU pendant toute la durée de l’appel.
Précisons, dialog-RSN-1 ne prend en compte l’audio qu’au niveau de l’entrée : un modèle d’IA analyse les données audio brutes et confie la génération de la sortie à un système de synthèse vocale (TTS) distinct, pouvant être piloté par des invites. Il est interrogé à la demande plutôt que diffusé en continu : un VAD à haut taux de rappel, associé à quelques temporisateurs, décide du moment où l’exécuter, et le premier token de la réponse détermine si l’agent doit prendre la parole. De simples indices acoustiques ne servent qu’à choisir le moment de poser une question ; c’est le modèle, disposant du contexte complet, qui prend la décision finale concernant la prise de parole.
PolyAI a procédé à un entraînement complémentaire de modèles multimodaux à poids ouverts, avec un affinage supervisé et par renforcement sur des données internes. Le pipeline est globalement indépendant du modèle de base ; PolyAI a évalué Gemma, GPT-OSS, Qwen et Mistral. L’objectif d’un temps de traitement inférieur à 300 ms sur des GPU A100 place les candidats dans une fourchette allant de 8 milliards de paramètres denses à 30 milliards de paramètres clairsemés. Les travaux sur la latence comprennent le préremplissage du cache d’attention pendant que l’utilisateur parle, un modèle de prompt en « ajout seul » (append-only) visant à minimiser l’invalidation du cache, l’acheminement de chaque interlocuteur vers le même GPU, un générateur spéculatif optimisé présentant un taux d’acceptation moyen de 3,9 tokens, ainsi qu’un raisonnement automatique appris au cours de la phase RFT. La transcription s’effectue en dernier, après la réponse ou l’appel de l’outil, en parallèle de la génération de la parole.
PolyAI a évalué son modèle sur Dialog-Eval, un benchmark interne qu’il prévoit de mettre en open source. Chaque exemple correspond à un appel tronqué à un point de décision, où l’on évalue une seule étape suivante « atomique » plutôt qu’un déroulement complet. PolyAI indique que Dialog-RSN-1 est le modèle capable de fonctionner en temps réel ayant obtenu le meilleur score, estime le plafond du score Audio-score en cascade à environ 77, et note que GPT Realtime 2.1 obtient un score équivalent à celui des modèles en cascade sur les exemples tenant compte de l’audio. En matière de transcription, le taux d’erreurs de mots (WER) de gpt-4o-transcribe est passé de 7,8 % à 6,9 % avec le même contexte, tandis que celui de Dialog-RSN-1 était encore plus bas.
Pour cette version, PolyAI s’est concentré sur l’anglais ; Raven 3.5 reste sa recommandation pour les langues autres que l’anglais et les chats web riches. Un rapport technique et un article pour Dialog-Eval sont prévus.
Vous souhaitez collaborer avec nous pour promouvoir votre dépôt GitHub, votre page Hugging Face, le lancement d’un produit, un webinaire, etc. ? Contactez-nous.
L’écosystème continuera probablement de s’ajuster dans les semaines à venir.
À découvrir aussi :
- Google dévoile Gemini Robotics 2.0, qui promet une dextérité et une sécurité accrues
- Repousser les limites du rapport qualité-prix avec GPT-5.6
- Comment l’activation de deux paramètres a permis de tripler nos scores au benchmark ARC-AGI-3
Source : MarkTechPost : MarkTechPost