L’écosystème de l’intelligence artificielle continue sa progression à un rythme soutenu.
Z.ai lance la version GLM-5.3 sans réentraînement du modèle de base : des performances améliorées pour le codage complexe et les tâches à long terme
Z.ai vient de publier GLM-5.3. GLM-5.3 s’appuie sur le même modèle de base 743B que GLM-5.2. Tous les gains constatés proviennent d’un post-entraînement à plus grande échelle : davantage d’environnements de tâches, davantage de types d’environnements, un entraînement plus long. Les résultats se répartissent en deux catégories. C’est dans le domaine du codage que les progrès sont les plus marqués sur les benchmarks à long terme, Terminal-Bench 3.0 passant de 4,6 à 28,3. La cybersécurité a progressé au-delà des prévisions de Z.ai, CyberGym atteignant 84,5 %. Les poids ne sont pas encore publics.
Le modèle GLM-5.3 est partiellement disponible via l’API de Z.ai, le « GLM Coding Plan » et ZCode. Les poids n’ont pas encore été publiés. Z.ai indique qu’ils seront rendus publics environ deux semaines après le lancement, une fois que l’évaluation de la sécurité et le renforcement de la sécurité auront été menés à bien.
Le score de Terminal-Bench 3.0 passe de 4,6 à 28,3 par rapport à GLM-5.2. Celui de DeepSWE v1.1 passe de 46,2 à 66,9. Le score de Last Exam (CLI) des agents passe de 23,8 à 28,5. Sur GDPval-AA v2, qui couvre 44 professions, le GLM-5.3 obtient un score de 1 769.
Dans le cadre de « Z.ai Code Bench », un test d’évaluation interne, l’entreprise fait état d’une amélioration de 50 % par rapport à GLM-5.2. Elle indique un score de 31,4 % pour environ 50 000 tokens de sortie par tâche. Claude Opus 4.8 affiche un taux de 29,5 % pour 120 000 tokens. Claude Fable 5 reste en tête avec 39,5 % à effort maximal. Z.ai fait valoir qu’un benchmark privé réduit le risque de contamination.
Sur les suites publiques, GLM-5.3 se classe derrière GPT-5.6 Sol et Fable 5 dans divers évaluations de codage plus complexes. Tous les chiffres sont fournis par les éditeurs ; les paramètres relatifs au harnais, à la longueur du contexte et à l’échantillonnage sont détaillés dans l’annonce.
Z.ai classe celui-ci comme « non planifié ». Il a intégré des données relatives à la découverte de vulnérabilités dans l’espoir d’faire progresser son raisonnement sur les bogues individuels. Au lieu de cela, ses capacités n’ont cessé de se renforcer à mesure que l’entraînement progressait. Le modèle a commencé à élaborer des plans cohérents couvrant des chaînes d’exploitation complètes.
CyberGym, qui teste la détection et la validation à partir d’une approche « boîte blanche », passe de 77,2 % à 84,5 %. Ce résultat dépasse légèrement celui de Mythos 5 (83,8 %) et de GPT-5.6 Sol (83,6 %). ExploitBench, qui nécessite un raisonnement sur les causes profondes et un exploit fonctionnel, passe de 24,4 % à 54,4 %. Mythos 5 s’établit à 78,0 %. Sur ExploitGym, GLM-5.3 accomplit 105 tâches en deux heures et 130 en six heures. GLM-5.2 en accomplit respectivement 29 et 39. Mythos 5 en accomplit respectivement 181 et 247.
Reste à voir comment l’industrie va réagir à cette annonce.
Sur le même sujet :
Source originale : MarkTechPost : MarkTechPost