GeneBench-Pro d'OpenAI met les agents IA à l'épreuve dans le domaine de la biologie computationnelle
OpenAI a lancé GeneBench-Pro, un benchmark de recherche conçu pour évaluer si les agents d’IA sont capables de réaliser les analyses complexes et nécessitant un jugement approfondi requises dans le domaine de la biologie computationnelle en situation réelle. Contrairement aux benchmarks classiques axés sur la mémorisation de faits, GeneBench-Pro mesure ce qu’OpenAI appelle le « sens de la recherche » — c’est-à-dire la succession de décisions subjectives prises au cours d’une analyse scientifique, depuis l’interprétation de données ambiguës jusqu’à la détermination de la robustesse des résultats pour orienter les recherches ultérieures. Ce benchmark comprend 129 problèmes couvrant dix domaines, notamment la génétique statistique, la génomique du cancer, le diagnostic clinique et la pharmacogénomique. Les évaluateurs ont estimé que chaque tâche nécessiterait entre 20 et 40 heures de travail pour un expert humain — à un coût estimé à 200 dollars de l’heure —, contre un coût d’inférence par IA de quelques dollars seulement par tâche. Le modèle GPT-5.6 Sol d’OpenAI a atteint un taux de réussite de seulement 28,7 %, passant à 31,5 % en mode Pro — ce qui représente tout de même un bond significatif par rapport au score inférieur à 5 % obtenu par le GPT-5 sur le GeneBench original. Afin d’encourager une évaluation indépendante, OpenAI met en open source dix tâches sur Hugging Face et fournit un sous-ensemble de 50 questions à Artificial Analysis pour des tests de performance réalisés par des tiers.
Pourquoi Inbenta ?

