Gradium AI lance un nouveau modèle TTS par défaut : un taux de réussite de 81,0 % dans les cas difficiles avec un délai de 216 ms jusqu’au premier son

Un nouveau jalon vient d’être franchi dans l’univers de l’intelligence artificielle.

Gradium AI lance un nouveau modèle TTS par défaut : un taux de réussite de 81,0 % dans les cas difficiles avec un délai de 216 ms jusqu’au premier son

Les assistants vocaux échouent précisément sur les éléments les plus importants d’un appel : le numéro de commande, le numéro à rappeler, l’adresse e-mail que l’appelant doit noter. Gradium AI a lancé un nouveau système de synthèse vocale et l’a défini comme modèle par défaut dans son API et son Studio. L’entreprise annonce un taux de réussite de 81,0 % (évalué par des humains) sur un ensemble de 500 phrases complexes couvrant cinq langues, devançant ainsi Cartesia Sonic 3.6 (75,1 %) et ElevenLabs v3 Conversational (65,4 %). Le délai avant la première sortie audio est de 216 ms au P50 sur Coval, soit 170 ms de moins que le modèle qu’il remplace.

Oui, dès aujourd’hui, sans aucune migration. Gradium a activé ce système par défaut dans son API et sur Studio le 31 août 2026. Les voix existantes, y compris les clones personnalisés, continuent de fonctionner sans changement.

Gradium a constitué un ensemble d’évaluation de 500 phrases et l’a mis à disposition en open source sur Hugging Face sous licence CC BY 4.0 : 100 éléments répartis selon 10 critères dans cinq langues (EN, DE, FR, ES, PT). Sept critères élémentaires couvrent l’orthographe, les acronymes, les tokens alphanumériques, les dates, les nombres ordinaires, les grands nombres et les nombres à virgule flottante, ainsi que les adresses e-mail. Trois critères composites (commandes, tickets informatiques, réclamations) regroupent plusieurs de ces éléments en un seul cycle de traitement réaliste pour un agent.

L’évaluation est effectuée par des évaluateurs humains et suit des critères stricts. Une phrase n’est validée que si un évaluateur indépendant, locuteur natif, constate que chaque élément est prononcé correctement et dans son intégralité ; l’omission d’un seul chiffre entraîne l’échec de la phrase. Le volume audio a été normalisé, l’ordre des phrases a été randomisé, et le nombre de comparaisons effectuées par chaque évaluateur a été limité à 40, avec une pause obligatoire.

Résultats regroupés selon les dix critères et moyennés sur les cinq langues avec une pondération égale : Gradium TTS 81,0 %, Cartesia Sonic 3.6 75,1 %, ElevenLabs v3 Conversational 65,4 %, Fish Audio S2.1 Pro 49,5 %, Inworld TTS 1.5 Max 46,5 %. Tous générés en août 2026 avec les paramètres par défaut.

Selon le benchmark TTS d’OnCoval, Gradium affiche un temps P50 jusqu’au premier son de 216 ms, soit 170 ms de moins que le modèle d’IA qu’il remplace. Le chiffre le plus parlant est toutefois l’écart : un intervalle interquartile p75-p25 de 30 ms sur 480 essais, soit le plus faible des cinq modèles testés. Cartesia Sonic 3.6 affiche une médiane de 454 ms avec un écart de 165 ms, soit 36 % de sa propre médiane, et les appelants subissent des variations extrêmes plutôt que des valeurs médianes.

Dans la foulée, gradium n’est pas le modèle d’IA le plus rapide de ce classement. Inworld TTS 2 affiche une médiane de 166 ms ; Fish Audio S2.1 Pro (291 ms) et ElevenLabs v3 Conversational (329 ms) se classent derrière Gradium. L’argument avancé porte sur la position conjointe : le taux d’échec le plus faible dans les cas difficiles pour une première sortie audio inférieure à 250 ms, avec une variance très faible.

Le contexte technologique évolue, et ce type d’annonce en témoigne.

À découvrir aussi :


Tel que rapporté par MarkTechPost : MarkTechPost