OpenAI lance LifeSciBench, un benchmark comprenant 750 tâches qui évalue les modèles d’IA sur des projets de recherche réels en sciences de la vie à l’aide d’une grille d’évaluation rédigée par des experts

L’actualité tech du jour met en lumière un développement significatif.

OpenAI lance LifeSciBench, un benchmark comprenant 750 tâches qui évalue les modèles d’IA sur des projets de recherche réels en sciences de la vie à l’aide d’une grille d’évaluation rédigée par des experts

La plupart des tests de référence en biologie posent des questions précises, fondées sur des faits, et dont les réponses sont claires. Les scientifiques évaluent des preuves imparfaites et prennent des décisions. OpenAI a lancé LifeSciBench, qui vise directement à combler cette lacune.

Point notable, même le système le plus performant ne réussit qu’environ une tâche sur trois. Le benchmark est donc loin d’avoir atteint ses limites.

Ces sept processus couvrent le traitement et l’analyse des informations.

LifeSciBench contient 750 tâches élaborées par des experts. Elles couvrent sept flux de travail et sept domaines biologiques. Chaque tâche comprend une consigne, des ressources d’accompagnement et une grille d’évaluation.

Ces sept processus couvrent le traitement et l’analyse des informations. Ils englobent également la conception et l’optimisation, le raisonnement scientifique, la validation et l’exploitation, la transposition et la communication scientifique.

De plus, ces sept domaines vont de la génomique et de la chimie médicinale aux sciences cliniques et translationnelles.

Les exercices sont rédigés comme un scientifique s’adresserait à un collègue. Il s’agit d’exercices à réponse libre, et non de questions à choix multiples. Environ 79 % d’entre eux nécessitent plusieurs étapes de raisonnement ou de prise de décision, avec une moyenne de quatre étapes par exercice.

L’avenir dira si cette annonce tient toutes ses promesses.

Sur le même sujet :


Information publiée en premier lieu par MarkTechPost : MarkTechPost