L’IA pour tous, dans toutes les langues

Une évolution notable vient d’être rendue publique dans le domaine.

L’IA pour tous, dans toutes les langues

Nous allons au-delà de la traduction de texte classique pour développer des modèles capables de comprendre les langues riches et vivantes du monde tel qu’elles s’expriment réellement.

Par ailleurs, google utilise l’intelligence artificielle pour aider les gens à communiquer dans des centaines de langues, y compris celles qui étaient jusqu’alors exclues des technologies. Au lieu de se contenter de traduire du texte, l’entreprise forme l’IA à comprendre les émotions, le ton et l’argot que les gens utilisent réellement dans la vie de tous les jours. Ils collaborent également avec les communautés locales partout dans le monde afin de s’assurer que leurs outils soient accessibles à tous, même à ceux qui ne disposent pas d’une connexion Internet fiable. Cela permet de garantir que la technologie respecte les différentes cultures et aide chacun à se faire comprendre selon ses propres termes.

Aujourd’hui, nos technologies et nos produits facilitent les interactions quotidiennes dans plus de 300 langues, parlées par plus de 7 milliards de personnes, soit 86 % de la population mondiale. Atteindre ce cap est significatif, mais cela met également en évidence un travail essentiel à notre mission. Depuis des décennies, la technologie a surtout profité à une poignée de langues dominantes, laissant des milliers de langues et de dialectes vivants sous-représentés, voire totalement absents, du monde numérique.

Précisons, lorsque nous avons lancé Google Translate en 2006, notre objectif était simple : faire tomber les barrières entre les langues. Les progrès de l’intelligence artificielle nous ont permis de partager cette vision avec un public plus large, et d’étendre la couverture de Translate d’une poignée de langues à plus de 250 aujourd’hui. Mais la traduction de textes ne suffit pas. La technologie doit comprendre comment les gens communiquent réellement dans le monde réel. C’est pourquoi nous concentrons nos efforts de recherche et progression sur la création de systèmes qui tiennent compte des nuances culturelles et de la richesse du langage humain, permettant ainsi à chacun de participer et d’être compris selon ses propres termes.

Dans le même temps, historiquement, les systèmes de reconnaissance vocale suivaient un processus rigide en divers étapes : transcription de l’audio en texte, traitement de ce texte, puis resynthèse en audio. Bien que fonctionnel, ce processus élimine les aspects les plus riches de la communication humaine : le ton, le rythme, l’émotion et le contexte.

On ne s’exprime pas toujours avec des phrases parfaitement construites et grammaticalement correctes. On rit, on se coupe la parole, on hésite et on mélange plusieurs langues au milieu d’une phrase, comme lorsqu’on parle du « spanglish » ou du « hinglish ».

Dans le même temps, pour y parvenir, nous sommes allés au-delà des transcriptions textuelles pour nous tourner vers l’intelligence audio native : nous avons entraîné des modèles tels que Gemini à traiter directement les fichiers audio tels quels, tout en saisissant à la fois le son et l’intention. Ces efforts comprennent notamment :

Ce développement s’ajoute à une longue série d’évolutions dans le secteur.

Pour aller plus loin :


Article original publié par Google AI : Google AI