L’écosystème de l’intelligence artificielle continue sa progression à un rythme soutenu.
Fastino lance GLiNER2.5 : une architecture de prédiction des limites qui élimine l’énumération des segments dans l’extraction d’informations
Les équipes chargées de l’extraction d’informations sont régulièrement confrontées à un dilemme. Les petits modèles d’encodage sont peu coûteux mais rigides, tandis que les grands modèles linguistiques offrent une grande flexibilité mais sont onéreux par document. Fastinore a lancé GLiNER 2.5 afin de combler cet écart. Cette récente version remplace l’énumération des segments par la prédiction des limites : le modèle attribue un score aux points de début et de fin d’une entité, au lieu d’évaluer chaque segment candidat par rapport à une grille de largeurs. Cette seule modification supprime la limite de largeur des entités, permet un contexte de 4 096 mots et garantit un calcul linéaire par rapport à la longueur de la séquence pour un schéma fixe. Elle ouvre par ailleurs la voie au décodage conjoint entité-relation, aux contraintes de libellés inter-tâches et aux attributs par segment. Sur 16 tests de performance « zero-shot », le système multilingue atteint un score F1 macro global de 56,17 contre 56,09 pour GLiNER2, avec un gain de 24,75 points sur XNLI. Trois modèles de référence sont disponibles sur Hugging Face sous licence Apache 2.0, avec respectivement 74 millions, 194 millions et 287 millions de paramètres.
Par ailleurs, oui, Fastinore a publié trois points de contrôle GLiNER 2.5 sur Hugging Face sous licence Apache 2.0, avec une inférence locale sur CPU, CUDA ou MPS via la commande `pip install « gliner2[local] »` (Python 3.10+). Aucun fournisseur d’inférence n’héberge actuellement ces checkpoints ; l’auto-hébergement est donc la seule option de déploiement.
Les premiers modèles GLiNER localisaient les entités en énumérant les segments candidats : chaque position de début était associée à chaque largeur autorisée, chacune étant évaluée par rapport au schéma. Cette conception liait le calcul à un axe de largeur et imposait une limite maximale stricte à la longueur des entités.
GLiNER 2.5 supprime l’énumération. L’encodeur partagé continue de traiter les requêtes de texte et de schéma en un seul passage. Au lieu d’attribuer des scores aux segments, le modèle d’IA prédit des scores de début et de fin au niveau des limites des tokens, ainsi que des scores internes pour chaque token. Une étape de proposition clairsemée sélectionne les débuts et les fins les plus prometteurs pour chaque requête et les associe, sans aucune restriction quant à la distance. Une tête de reclassement attribue ensuite un score à chaque candidat en fonction des indices de délimitation et du contenu de la séquence. Les candidats à la relation sont issus du même vivier plutôt que d’un parcours distinct.
L’équipe Fastino indique que le temps de calcul reste linéaire par rapport à la longueur de la séquence pour un schéma et un budget candidat donnés.
Fait intéressant, ces trois éléments partagent la même API publique. Utilisez « withAutoExtractor » pour le chargement, et non l’ancien chargeur « GLiNER2span ».
L’équipe Fastino évalue la méthode « zero-shot » sur 16 ensembles de données publics et présente le score F1 global par rapport à GLiNER2 pour des tailles équivalentes.
Un dossier qu’il faudra continuer à observer dans les mois à venir.
Dans le même ordre d’idées :
- Les meilleurs Neoclouds GPU de 2026 : CoreWeave, Nebius, Lambda, Crusoe et Groq, classés en fonction de leurs tarifs publiés et de leur puissance souscrite
- Découvrez S1-mini : le normalisateur de texte à poids ouverts de 462 Mo développé par Superwhisper, qui transforme les transcriptions brutes issues de la reconnaissance vocale en texte écrit propre.
- Cartesia lance Sonic-3.6 : un modèle d’IA de synthèse vocale en streaming qui domine désormais les deux principaux champs d’application de la synthèse vocale artificielle
Lire l’article complet sur MarkTechPost : MarkTechPost