Gradium lance « stt-translate » et « s2s-translate », des modèles de traduction vocale en temps réel qui surpassent « gpt-realtime-translate » en termes de précision et de latence

Le secteur de l’IA vient d’être le théâtre d’un développement notable.

Gradium lance « stt-translate » et « s2s-translate », des modèles de traduction vocale en temps réel qui surpassent « gpt-realtime-translate » en termes de précision et de latence

Gradium a lancé aujourd’hui deux modèles de traduction vocale en temps réel : « stt-translate » et « s2s-translate ». Tous deux prennent en charge cinq langues et affichent les retombées en direct dans le navigateur.

Dans le même temps, gradium revendique un meilleur compromis entre précision et latence que « gpt-realtime-translate » et « gemini-3.5-live-translate ». Il offre également des fonctionnalités de contrôle vocal en sortie, notamment le clonage, qui font défaut à « gpt-realtime-translate ».

Vous recevez à la fois le flux audio synthétisé et la transcription traduite au fur et à mesure de leur production.

En parallèle, stt-translate convertit un discours dans une langue en texte dans une autre. Il prend en charge l’anglais (EN), le français (FR), l’allemand (DE), l’espagnol (ES) et le portugais (PT).

Point notable, n’importe quelle source peut être associée à n’importe quelle cible au sein de cet ensemble. Cela représente au total 20 paires de langues, dans toutes les directions.

Autre élément, le choix conceptuel essentiel consiste à regrouper deux étapes en une seule. La transcription et la traduction s’effectuent en un seul passage, au sein même du modèle de reconnaissance vocale. Il n’y a donc pas de transcription intermédiaire à attendre, ni de transfert entre les systèmes.

Selon Gradium, cette approche s’appuie sur le framework Hibiki-Zero. Le modèle optimise à la fois la faible latence et la haute précision grâce à l’apprentissage par renforcement. Cela se traduit par une réduction du nombre d’éléments mobiles dans le pipeline.

s2s-translate convertit un enregistrement audio dans une langue en un enregistrement audio dans une autre, de bout en bout. Ce service s’appuie sur stt-translate et l’associe à un modèle d’IA TTS de Gradium au sein d’un même service.

De plus, vous diffusez le flux audio via un WebSocket. Vous recevez à la fois le flux audio synthétisé et la transcription traduite au fur et à mesure de leur production.

Cette actualité s’inscrit dans une dynamique plus large qui mérite d’être suivie.

À lire également :


Lire l’article original sur MarkTechPost : MarkTechPost