Z.ai lance GLM-5.3-Flash : un modèle MoE multimodal natif de 320 milliards de paramètres et 18 milliards de mots, doté d’un contexte de 1 million de tokens

Le secteur technologique continue de livrer des avancées remarquables.

Z.ai lance GLM-5.3-Flash : un modèle MoE multimodal natif de 320 milliards de paramètres et 18 milliards de mots, doté d’un contexte de 1 million de tokens

Z.ai a lancé GLM-5.3-Flash, le premier modèle d’IA multimodal natif de la série GLM-5 et le modèle de codage capable le moins cher jamais commercialisé par le laboratoire. Il s’agit d’un modèle de type « mixture-of-experts » comptant 320 milliards de paramètres au total et 18 milliards de paramètres actifs par token, doté d’une fenêtre contextuelle de 1 048 576 tokens et acceptant des entrées image et vidéo. Il est publié sous licence MIT et ses poids sont disponibles sur Hugging Face. Selon les rapports de Z.ai, il surpasse GLM-5.2 dans tous les tests de performance et les charges de travail réelles pour un prix environ dix fois inférieur, tout en se situant à moins d’un demi-point de Claude Opus 4.8 dans son test interne de codage. Le modèle a passé sa première semaine à fonctionner de manière anonyme sous le nom d’« Ox Alpha » sur OpenCode et OpenRouter, entièrement hébergé sur des puces d’IA de fabrication chinoise.

Oui, sur deux volets. Les modèles sont disponibles en ligne sur Hugging Face sous une licence MIT, et une API hébergée est déjà tarifée et opérationnelle.

La vision est son point faible : il est à la traîne par rapport à Gemini 3.7 Flash sur BabyVision et MVbench.

GLM-5.3-Flash s’appuie sur un modèle de base récemment entraîné sur un corpus multimodal de 30 T de tokens. Il convient de noter trois changements :

À noter également, la plupart des chiffres mentionnés dans le tableau ci-dessous proviennent de Z.ai et les configurations varient d’un test à l’autre — les notes de bas de page de la fiche du modèle précisent la température, les limites contextuelles et les modèles d’évaluation pour chaque benchmark ; il convient donc de considérer les comparaisons entre modèles comme dépendantes de la configuration.

Par ailleurs, Artificial Analysis obtient un score de 57 à l’indice d’intelligence, avec un débit de 48,7 tokens/seconde et un temps de traitement (TTF) de 1,52 seconde sur l’API de Z.ai — un excellent rapport intelligence/prix, mais un système lent et prolixe. La vision est son point faible : il est à la traîne par rapport à Gemini 3.7 Flash sur BabyVision et MVbench.

Z.ai précise que l’ensemble de la préversion d’Ox Alpha a tourné sur des puces d’IA chinoises de fabrication nationale, à l’aide d’un moteur personnalisé basé sur SGLang qui sépare les étapes d’encodage, de préremplissage et de décodage, et annonce une amélioration de 3 fois des performances de service de bout en bout sur des dizaines de milliers d’accélérateurs.

Un dossier qu’il faudra continuer à observer dans les mois à venir.

Sur le même sujet :


Couverture originale : MarkTechPost : MarkTechPost