NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours.

NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base

NVIDIA a lancé Audex (Nemotron-Labs-Audex-30B-A3B), un grand modèle linguistique unifié combinant audio et texte. Il comprend et génère à la fois du contenu audio et de la parole. Il conserve également les capacités d’intelligence textuelle de son architecture de base. Les points de contrôle, ainsi qu’une version plus petite, Audex-2B, sont mis à disposition sous une licence à usage non commercial.

À ce sujet, la plupart des modèles multimodaux pâtissent d’un « coût du texte ». Lorsque les laboratoires y ajoutent une sortie audio ou visuelle, les performances des tests de référence textuels ont souvent tendance à baisser. L’équipe de travaux de recherche de NVIDIA signale ce phénomène même pour les modèles dont la sortie est exclusivement vocale. Audex est conçu pour éviter cette régression.

Audex est un décodeur Transformer de type « Mixture-of-Experts » (MoE) unique. Il compte 30 milliards de paramètres au total, dont 3 milliards sont activés par token. Son architecture de base est Nemotron-Cascade-2-30B-A3B, un LLM MoE dédié exclusivement au texte. Cette architecture de base est un Transformer hybride de type Mamba comportant 52 couches. Elle utilise 128 experts routables et 6 experts activés.

La conception est volontairement simple. Les entrées audio sont encodées puis projetées dans l’espace d’intégration du texte. Les tokens textuels et les tokens audio quantifiés sont ensuite traités de manière uniforme lors de la génération. Il n’y a ni séparation entre le « penseur » et le « locuteur », ni empilement en cascade de modèles.

Grâce à sa conception simple, Audex fonctionne sur des piles LLM standard. Celles-ci comprennent Megatron-LM pour l’entraînement et vLLM pour l’inférence. Il prend en charge à la fois un mode « instruction » et un mode « réflexion ». La longueur du contexte atteint 1 million de tokens.

Audex utilise deux codecs pour la sortie. Pour la parole, il utilise le codec X-Codec2 à un débit de 50 tokens par seconde. Il applique une quantification scalaire finie (FSQ) à couche unique avec un livre de codes de 65 536 entrées.

Les sons non vocaux utilisent le codec X à raison de 200 tokens par seconde. Ce codec utilise quatre couches de quantification vectorielle résiduelle aplatie (RVQ). Les sons complexes bénéficient d’un budget de tokens plus important que la parole. La démo interactive ci-dessous calcule ces nombres de tokens pour n’importe quelle durée.

Audex ne nécessite aucun pré-entraînement audio. Il part du point de contrôle SFT « texte seul ». L’entraînement ajoute ensuite des capacités étape par étape.

Les acteurs concernés devront s’adapter à ce nouveau contexte.

Dans le même ordre d’idées :


Via MarkTechPost : MarkTechPost