L’actualité tech du jour met en lumière un développement significatif.
Keenable AI met en open source NEEDLE : un benchmark de exploration en temps réel qui renouvelle son ensemble de requêtes toutes les heures
Comment évaluer les performances d’une API de recherche Web lorsque le système testé est capable de lire le corrigé ? Un agent de recherche dispose d’un outil de récupération. Si les étiquettes de référence se trouvent dans un ensemble de informations public, l’agent peut les télécharger en cours d’évaluation et éviter de ce fait complètement la phase de recherche. Un problème similaire se pose lorsque les réponses sont déjà encodées dans la mémoire paramétrique du système : une réponse correcte ne prouve plus que la recherche sur le Web a fonctionné. La réponse de Keenable est NEEDLE, un benchmark open source en temps réel qui reconstitue son ensemble de requêtes à partir de sources publiques actualisées, plutôt que d’en figer un. Les requêtes d’actualité sont régénérées toutes les heures à partir de flux RSS et de Google Trends ; les requêtes financières, universitaires, juridiques et portant sur des entités rares sont régénérées quotidiennement à partir des données XBRL de la SEC, d’arXiv, d’Europe PMC, de CourtListener et des registres publics des agents. Quinze API de recherche traitent le même texte de requête selon un protocole unique, et chaque score est comparé à « ultimate », un moteur oracle regroupant les performances de l’ensemble du domaine.
Oui, il s’agit d’un cadre d’évaluation open source plutôt que d’un produit. « needleis » est une interface en ligne de commande (CLI) Python installée avec « uv sync » et pilotée par deux sous-commandes par benchmark : « generate » et « run ». Il nécessite une clé OpenRouter pour l’évaluation et une clé API par moteur testé, et s’exécute sur un ordinateur portable ou dans un environnement d’intégration continue (CI). Il permet de recréer tous les flux de requêtes utilisés, en plus des évaluations de la qualité du classement.
Les pages ne sont jamais récupérées et les résultats ne sont jamais reclassés.
NEEDLE est l’acronyme de « News » (actualités), « Everyday » (au quotidien), « Expert » (expert), « Deep-tail » (spécialisé) et « Legal Evaluation » (évaluation juridique). Chaque axe vertical modélise une intention différente de l’agent. « News » transpose l’actualité la plus récente issue d’environ 124 flux RSS sélectionnés et de Google Trends en une requête par mot-clé. « Finance » interroge les éléments issues de Wikidata et du GLEIF, de cette manière que les chiffres trimestriels du formulaire 10-Q provenant du format XBRL de la SEC.« Scholar » transforme un article en quatre styles de requête : un titre simplifié, un détail en texte intégral uniquement, un indice en langage naturel et une description vague du type « j’ai ça sur le bout de la langue ».Deep-tail échantillonne des requêtes contenant des mots rares issues de publications publiques sur les trajectoires d’agents, notamment DeepResearchGym, OpenResearcher et LRAT. Legal extrait les avis récents de CourtListener provenant de 14 tribunaux fédéraux et des sections de l’eCFR.
Dans le même temps, l’évaluation suit la même logique. Les catégories « Actualités » et « Deep-tail » n’ont pas de résultat unique correct ; un évaluateur LLM attribue donc à chaque résultat une note comprise entre 0 et 4, et le harnais rapporte le nDCG@5 avec une pénalité pour les URL en double. La catégorie « Finance » rapporte l’answer-recall@5 : l’information figure-t-elle dans l’un des 5 premiers extraits présentés à l’agent ? Les domaines « Scholar » et « juridique » sont des tâches portant sur des éléments connus, notées en fonction de la correspondance des identifiants.
Chaque moteur reçoit le même texte de requête. Le programme d’exécution envoie un appel à la fois, ce qui permet de comparer les centiles de latence et d’éviter que les moteurs ne soient soumis à une charge simultanée. L’évaluation s’effectue sur la base du classement, des titres et des extraits propres à chaque moteur. Les pages ne sont jamais récupérées et les résultats ne sont jamais reclassés. Les pièces à conviction sont limitées à 2 000 caractères pour tout le monde, et le juge ne voit pas le nom du moteur.
Le chiffre le plus intéressant est le plafond ultime. Pour chaque requête, NEEDLE regroupe les résultats renvoyés par chaque moteur au sein d’un moteur oracle synthétique, puis classe cet ensemble combiné par ordre de pertinence. Cela permet d’établir un plafond empirique basé sur ce que l’ensemble des moteurs a été capable de récupérer.
L’évolution de ce dossier sera à suivre avec attention.
À découvrir aussi :
Source : MarkTechPost : MarkTechPost