Google annonce « Gemini 3.5 Transcribe », un solution de transcription vocale alimenté par l’IA

Un développement récent dans le monde de l’IA attire l’attention.

Google annonce « Gemini 3.5 Transcribe », un solution de transcription vocale alimenté par l’IA

L’IA qui alimente la fonctionnalité « Rambler » de Gboard va être étendue à d’autres produits Google, notamment Chrome.

En attendant (peut-être en vain) le introduction de Gemini 3.5 Pro, Google dévoile un autre modèle de la branche 3.5. La société a annoncé Gemini 3.5 Transcribe, un système d’IA conçu pour optimiser la saisie vocale en supprimant les « euh » et les corrections, afin de produire un texte généré par l’IA au style soigné. Ce modèle équipe déjà la fonctionnalité « Rambler » de Gboard sur le Pixel 11, mais il est sur le point de faire son apparition dans l’ensemble de l’écosystème Google.

Selon Google, Gemini 3.5 Transcribe est bien plus rapide et plus précis que son précédent moteur de conversion de la parole en texte, baptisé Chirp 3. Ce tout nouveau modèle d’IA d’IA devrait être environ 70 % plus rapide, de la parole au texte transcrit final, et le taux d’erreur sur la parole en direct a baissé à 5,5 %. Ce n’est guère mieux que Chirp 3, dont le taux d’erreur, selon Google, s’élève à 7,32 %. Cela dit, corriger les fautes de frappe est toujours fastidieux lorsqu’on utilise la saisie vocale ; toute amélioration dans ce domaine est donc la bienvenue.

Crédit :
GoogleCrédit :

Google

Sur ce point, ce nouveau modèle ne se contente pas de mieux comprendre les mots que vous prononcez ; il serait également plus à même de cerner le sens profond de ce que vous vouliez dire. Pendant que vous parlez, Gemini 3.5 Transcribe peut supprimer les « euh » et les « hum » qui encombrent le fil de vos pensées. Il peut également corriger le texte à la volée si vous avez besoin de vous rectifier et se référer au vocabulaire personnalisé que vous avez fourni pour gérer le « jargon spécialisé ». Tout cela fonctionne dans 85 langues et avec jusqu’à trois locuteurs dans des enregistrements audio.

Il faut souligner, l’inconvénient, bien sûr, c’est que vous comptez sur l’IA pour saisir avec précision l’essentiel de votre discours. Pour les courts extraits de texte, le modèle semble performant pour corriger les incohérences et les hésitations verbales (d’après les tests que j’ai effectués avec Rambler), toutefois l’IA modifie techniquement la formulation de ce que vous avez dit, ce qui peut ne pas convenir à toutes les situations.

Gemini 3.5 Transcribe est déjà disponible sur certaines plateformes, notamment Rambler dans Gboard. Toutefois, cette fonctionnalité reste pour l’instant réservée aux smartphones Pixel 11. Google indique qu’il étendra Rambler à « davantage d’appareils équipés de Gemini Intelligence » dans le courant de l’année. Si vous utilisez l’application Gemini sur macOS, votre saisie vocale bénéficiera également de la fonctionnalité « Gemini 3.5 Transcribe » dès aujourd’hui.

À retenir de cette annonce :

  • Tout cela fonctionne dans 85 langues et avec jusqu’à trois locuteurs dans des enregistrements audio.
  • L’inconvénient, bien sûr, c’est que vous comptez sur l’IA pour saisir avec précision l’essentiel de votre discours.
  • Toutefois, cette fonctionnalité reste pour l’instant réservée aux smartphones Pixel 11.

Pour les professionnels du domaine, cette annonce mérite d’être surveillée.

À lire également :


Article original publié par Ars Technica AI : Ars Technica AI