Pokee AI lance Pokee-Isaac 28B : un système agentique contextuel de 10 millions de tokens conçu pour fonctionner au sein de l’environnement du client

L’intelligence artificielle reste au cœur de toutes les attentions.

Pokee AI lance Pokee-Isaac 28B : un système agentique contextuel de 10 millions de tokens conçu pour fonctionner au sein de l’environnement du client

Les agents à long terme accumulent du contexte plus promptement qu’ils ne résolvent les tâches. Chaque résultat d’outil, chaque observation et chaque étape intermédiaire de raisonnement reste dans la fenêtre, et les deux aptitudes essentielles — conserver ce contexte et rester cohérent tout au long de celui-ci — n’étaient jusqu’à présent disponibles que sur les terminaux cloud. Cela exclut les secteurs réglementés, les institutions du secteur public et les applications embarquées, où les éléments ne sont en aucun cas autorisées à sortir de cette zone délimitée. Pokee AI a lancé « Pokee-Isaac 28B », un modèle de base de 28 milliards de mots, dédié exclusivement au texte et doté d’une fenêtre de contexte de 10 millions de tokens, conçu pour fonctionner à l’intérieur de cette zone délimitée. L’équipe de recherche de Pokee présentation un score de 93,3 % sur RULER avec 10 millions de jetons, une performance équivalente à celle des références cloud les plus performantes en termes d’optimisation des coûts sur les benchmarks agentiques, ainsi qu’un profil de service adapté à un seul GPU.

Oui, mais sous licence, et non en open-weight. Pokee AI fournit Isaac via une API développeur compatible avec OpenAI, et propose des licences pour un déploiement au sein d’un VPC, sur site ou sur appareil. L’annonce de lancement met en avant la prise en charge dès le premier jour (Day-0) de vLLM et SGLang, de cette manière que le service sur un seul GPU à partir d’une RTX 4090 ou d’un modèle équivalent. L’équipe de recherche ne publie que les mesures issues d’un seul GPU de classe B200 ; il convient donc de considérer l’affirmation concernant les GPU grand public comme une indication fournie par le fabricant plutôt que comme un résultat avéré.

Sur OnRULER, Isaac reste au-dessus de 93,3 % quelle que soit la longueur testée, pour terminer à 93,3 % à 10 Mo. GPT-5.6 Luna et Gemini 3.5 Flash Lite le suivent jusqu’à 512 Ko, puis atteignent la limite de contexte à 1 Mo.

Sur l’OnMRCR v2 à 8 aiguilles, Isaac obtient des scores de 0,607, 0,743 et 0,500 à 256 K, 512 K et 1 M. Son avance sur Gemini passe de 0,133 à 0,295 sur cette plage.

Isaac est en tête du classement BFCL v4 avec un score de 70,94, contre 70,61 pour Luna. Le rapport qualifie cela de « parité » plutôt que d’« avance », ce qui est l’interprétation correcte. Sur le τ³-benchit, il affiche une moyenne de 0,662 sur quatre champs d’application, devant Gemini (0,631), avec un score de 0,186 en banque, domaine jugé difficile par tous. Sur le MCP-Atlas, il se classe troisième avec une couverture de 74,59 %, mais utilise 9,10 itérations par tâche contre 14,99 pour Gemini. Dans le test OnTerminal-Bench 2.1, il résout 56 des 86 tâches compatibles avec le texte (65,1 %), derrière les 60 de Luna. C’est le seul test de performance où une outil de référence cloud s’impose, et le rapport l’indique clairement.

Sur ce point, lors des tests de pré-équipe OnDTAP, Isaac affiche les taux de réussite d’attaque les plus bas, tant en attaque directe (36,0) qu’indirecte (35,2) et combinée (35,6), avec un taux de réussite « bénin » de 82,5. Une différence toutefois : les tests de référence ont été effectués avec le programme d’exécution par défaut, tandis qu’Isaac a été testé avec le harnais Pokee.

Avec la charge de travail RULER sur un GPU de classe B200, le TTFT est de 23,6 s pour 1 million et de 72,9 s pour 10 millions. Le débit de préremplissage augmente avec le contexte, passant de 42 400 à 137 200 tokens/s ; par conséquent, une invite dix fois plus longue coûte environ trois fois le TTFT. Le prix catalogue est de 0,15 $/1,00 $ par million de tokens d’entrée/sortie, à titre provisoire. Isaac fonctionne également entièrement en local sur les processeurs Intel Arc Pro B70 et Core Ultra Series 3 (Panther Lake), ainsi que sur le Qualcomm Snapdragon X2 Elite.

Les analystes auront matière à débattre dans les prochaines semaines.

À découvrir aussi :


Lire l’article complet sur MarkTechPost : MarkTechPost