Poolside lance Laguna S 2.1, un système de codage agentique à poids ouvert qui surpasse ses concurrents dans sa catégorie sur le banc de test multilingue SWE-Bench

Les développements se succèdent à un rythme impressionnant dans l’IA.

Poolside lance Laguna S 2.1, un système de codage agentique à poids ouvert qui surpasse ses concurrents dans sa catégorie sur le banc de test multilingue SWE-Bench

Poolside a publié Laguna S 2.1, un système à poids ouverts de 118 milliards de paramètres conçu pour le codage agentique. Il s’agit d’un modèle de type « Mixture-of-Experts » (MoE) comportant 8 milliards de paramètres activés par token. Il prend en charge une fenêtre contextuelle pouvant atteindre 1 million de tokens, aussi bien en mode « thinking » qu’en mode « no-thinking ». Les poids sont disponibles sur Hugging Face sous licence OpenMDW-1.1, et le modèle est suffisamment compact pour fonctionner sur un seul NVIDIA DGX Spark.

Dans les tests de performance en codage à long terme, Laguna S 2.1 tient la route face à des modèles plusieurs fois plus volumineux, notamment DeepSeek-V4-Pro-Max, Nemotron 3 Ultra de NVIDIA et Inkling de Thinking Machines. Laguna S 2.1 est une version à plus grande échelle de la famille Laguna XS, entraînée sur les mêmes informations de pré-entraînement que XS 2.1.

Le modèle active environ 6,8 % de ses paramètres pour chaque token. Les 118 milliards de paramètres restent tous en mémoire, mais seuls environ 8 milliards transitent par le réseau à chaque étape. C’est grâce à cette faible densité qu’un modèle de taille moyenne peut se comporter comme un modèle plus grand tout en restant peu coûteux à exploiter.

L’équipe Poolside publie les poids en BF16, FP8, INT4 et NVFP4, ainsi que les conversions officielles GGUF et MLX et les modèles préliminaires DFlash. Le projet est passé du début de l’entraînement au lancement en moins de neuf semaines. Le pré-entraînement a débuté le 22 mai 2026 sur 4 096 GPU NVIDIA H200. Il s’agit du premier système Poolside pour lequel l’apprentissage par renforcement a été exécuté en précision FP8.

Sur ce point, laguna S 2.1 obtient un score de 70,2 % sur Terminal-Bench 2.1 avec la fonction « thinking » activée. Cela le place en tête des modèles ouverts dont la taille est divulguée dans le classement établi par Poolside, derrière uniquement des systèmes plus volumineux ou fermés. Sur SWE-Bench Multilingual, il obtient un score de 78,5 %, se classant par conséquent en tête du classement publié. La comparaison complète publiée par Poolside est proposée ci-dessous.

Dans la foulée, le signal le plus clair vient de DeepSWE v1.1, qui dispose encore d’une marge de progression réelle. Dans ce cas, Laguna S 2.1 obtient un score de 40,4 % contre 9,0 % pour DeepSeek-V4-Pro-Max, avec environ un sixième des paramètres actifs. Les modèles à frontière fermée tels que Claude Fable 5 et Kimi K3 restent en tête sur de multiples benchmarks. L’affirmation de Poolside porte sur la catégorie de poids, et non sur la première place absolue. Les trajectoires issues de l’ensemble d’évaluation finale sont publiées sur trajectories.poolside.ai.

D’un autre côté, laguna S 2.1 dispose de deux modes : « off » et « max », le mode « max » étant activé par défaut. En mode « max », le modèle définit lui-même son budget de calcul au moment du test. Pour l’instant, Poolside est livré sans option permettant à l’utilisateur de configurer le niveau d’effort (faible, moyen ou élevé).

Pour les professionnels du domaine, cette annonce mérite d’être surveillée.

À découvrir aussi :


Couverture originale : MarkTechPost : MarkTechPost