Une évolution notable vient d’être rendue publique dans le domaine.
Interfaze lance « diffusion-gemma-asr-small », un système ASR open source basé sur la diffusion, capable de transcrire six langues grâce au décodeur à débruitage parallèle de DiffusionGemma.
Interfaze, une jeune start-up issue du programme Y Combinator, a mis en open source un nouveau modèle de reconnaissance vocale. Il s’appelle « diffusion-gemma-asr-small ». Ce modèle transcrit les enregistrements audio à l’aide d’un décodeur de diffusion, et non d’un décodeur autorégressif. Il est présenté comme le premier modèle multilingue de reconnaissance vocale (ASR) basé sur la diffusion. Un seul adaptateur prend en charge six langues. L’équipe de recherche n’a entraîné qu’environ 42 millions de paramètres par-dessus un réseau de base figé de 26 milliards de paramètres. Cela représente environ 0,16 % des poids du modèle.
Il convient ici de préciser d’emblée deux points. Les modèles autorégressifs génèrent du texte un token à la fois. Les modèles de diffusion affinent tous les tokens en parallèle. Ce système utilise l’approche par diffusion pour la reconnaissance vocale.
Ces jetons sont répartis dans les emplacements réservés de la prompt.
diffusion-gemma-asr-small est un modèle ASR natif audio. Il convertit la parole en texte à l’aide d’un décodeur à diffusion discrète. Ce décodeur fait partie de DiffusionGemma, le modèle « mixture-of-experts » de Google comptant 26 milliards de paramètres. DiffusionGemma active 4 milliards de paramètres, en utilisant 128 experts avec un routage « top-8 ». Il génère du texte par diffusion discrète plutôt que par autorégression.
Le mécanisme de diffusion est particulier. La plupart des modèles de langage de grande échelle (LLM) basés sur la diffusion utilisent un schéma de
Interfaze a ajouté la prise en charge audio à ce modèle exclusivement textuel. Par défaut, DiffusionGemma accepte du texte, des images et des vidéos. Il ne prend pas en charge l’audio. Le dépôt ne contient que l’adaptateur entraîné, qui compte environ 42 millions de paramètres. Les structures de base figées doivent être téléchargées séparément depuis leurs propres dépôts.
Le système ne transmet pas de formes d’onde brutes au LLM. Une première tentative avait précisément consisté à faire cela et s’était soldée par un échec. Un LLM « gelé » n’a jamais vu de spectrogramme. L’espace d’intégration ne comporte aucune notion de formants ou de phonèmes. Le modèle a appris à ignorer les données audio et à générer des absurdités avec aisance.
D’un autre côté, la conception actuelle utilise un « frozenwhisper-smallencoder ». Celui-ci sert uniquement d’extracteur de caractéristiques, et non de décodeur. Whisper convertit 30 secondes d’audio en 1 500 trames. Chaque trame contient des caractéristiques acoustiques à 768 dimensions. Un petit projecteur entraînable compresse ensuite ces trames. Il utilise des couches convolutives qui sous-échantillonnent à un facteur de 8, ainsi qu’une application linéaire. La sortie est constituée de 188 « jetons audio » de 2 816 dimensions. Ces jetons sont répartis dans les emplacements réservés de la prompt. Les adaptateurs LoRA permettent à l’architecture de base de prendre en charge cette nouvelle modalité. Le décodeur procède ensuite au débruitage d’une transcription de 192 tokens. Ce processus s’effectue de manière bidirectionnelle en environ 16 étapes.
Les premières sessions d’entraînement ont achoppé. Le taux d’erreur s’est stabilisé autour de 8. L’échec était circulaire. Le projecteur se lançait de manière aléatoire, ce qui faisait que sa sortie n’était que du bruit. Le modèle a alors appris à l’ignorer. Pratiquement aucun gradient n’atteignait le projecteur. Le modèle n’a jamais appris.
Il faudra attendre les retours concrets pour juger de l’impact réel.
Dans le même ordre d’idées :
- OpenClaw lance des applications compagnons pour iOS et Android permettant de connecter un téléphone à une passerelle d’agent IA auto-hébergée
- Liquid AI lance la version LFM2.5-230M avec prise en charge de llama.cpp, MLX, vLLM, SGLang et ONNX pour l’inférence sur appareil
Source originale : MarkTechPost : MarkTechPost