Le secteur de l’IA vient d’être le théâtre d’un développement notable.
Découvrez Needle 2 : un modèle ouvert de sélection d’outils comportant 45 millions de paramètres, fourni sous forme de fichier binaire de 14 Mo et capable d’exécuter une session complète avec seulement 28 Mo de mémoire vive.
Cactus Compute a lancé Needle 2, un modèle ouvert de 45 millions de paramètres destiné à l’appel d’outils, à l’utilisation de périphériques et à l’extraction structurée. Le modèle complet est fourni sous la forme d’un seul fichier binaire de 14 Mo qui nécessite environ 28 Mo de RAM pour exécuter une session complète. Les poids sont entraînés et déployés sur CQ2-bit à l’aide de Cactus Quants, et le modèle est intégré au moteur C++ propriétaire de l’entreprise ; il n’y a donc aucun runtime à installer ni aucun téléchargement à effectuer au moment de l’inférence. Le débit de décodage annoncé est de 500 tokens/sec sur un Raspberry Pi 5, de 400 à 1 500 tokens/sec sur le Meta Quest 3S et l’Apple Vision Pro, et de 300 à 700 tokens/sec sur des smartphones de moins de 200 $. Le principe de conception est simple et clairement énoncé par l’équipe : associer une phrase désordonnée à la signature d’une fonction typée ne nécessite aucune connaissance du monde réel ni aucun texte en prose ouvert. C’est cette approche qui explique pourquoi 45 millions de paramètres suffisent dans ce cas précis, et pourquoi le modèle est conçu pour fonctionner sur du matériel ne disposant ni de GPU ni de NPU.
À noter également, oui, Needle 2 est fourni sous forme de binaires précompilés et d’une bibliothèque statique pour macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS et WebAssembly. Selon Cactus, Pebble exécute déjà Needle en local dans l’application Index 01 pour les commandes vocales hors ligne.
L’étude sous-jacente est disponible sur arXiv sous le titre « A Controlled Study of Attention-Only Transformers ».
De plus, needle 2 utilise ce que l’équipe Cactus appelle un « Simple Attention Network ». Cette approche remplace le FFN par un MLP de Hadamard, conserve l’attention GQA, ajoute une mémoire engramme clé-valeur issue de tables de n-grammes hachées et utilise des hyper-connexions à divers voies. Le réseau comporte 27 couches et 512 unités de largeur. L’étude sous-jacente est disponible sur arXiv sous le titre « A Controlled Study of Attention-Only Transformers ».
L’entraînement préalable a été réalisé à partir d’un corpus propriétaire de 115 milliards de tokens, suivi d’un entraînement postérieur sur 38 milliards de tokens. L’équipe de recherche précise que le modèle LFM2.5-230M a été pré-entraîné sur 19 000 milliards de tokens.
Needle 2 consomme 70 MFLOPs par jeton, avec 35 millions de paramètres sur 45 millions actifs pour les multiplications matricielles. LFM2.5 230M consomme 460, FunctionGemma 270M consomme 540, et Apple FM avoisine les 6 000.
Les poids ne sont jamais décompressés en mémoire vive. Les codes à 2 bits sont développés à l’intérieur des registres vectoriels et fusionnés en produits scalaires entiers, de sorte que le chemin arithmétique reste en int8. Un fichier binaire interroge le processeur au démarrage et sélectionne un niveau de noyau : SDOT, NEON, AVX2, vecteurs RISC-V, SIMD WASM ou scalaire.
Cette actualité s’inscrit dans une dynamique plus large qui mérite d’être suivie.
Dans le même ordre d’idées :
- Ce que pensent les enfants de l’IA, selon leurs propres mots
- La marque de guitares D’Addario reconnaît avoir utilisé de la musique générée par IA dans une vidéo promotionnelle
- La toute dernière arme du Web contre les robots d’extraction d’informations basés sur l’IA est une police de caractères
Via MarkTechPost : MarkTechPost