GeneBench-Pro d'OpenAI met les agents IA à l'épreuve dans le domaine de la biologie computationnelle

7 juillet 2026
Automatiser l'expérience client grâce à l'IA conversationnelle
Découvrez la puissance d'une plateforme qui vous offre le contrôle et la flexibilité nécessaires pour offrir des expériences client enrichissantes à grande échelle.
Planifier une démo

OpenAI a lancé GeneBench-Pro, un benchmark de recherche conçu pour évaluer si les agents d’IA sont capables de réaliser les analyses complexes et nécessitant un jugement approfondi requises dans le domaine de la biologie computationnelle en situation réelle. Contrairement aux benchmarks classiques axés sur la mémorisation de faits, GeneBench-Pro mesure ce qu’OpenAI appelle le « sens de la recherche » — c’est-à-dire la succession de décisions subjectives prises au cours d’une analyse scientifique, depuis l’interprétation de données ambiguës jusqu’à la détermination de la robustesse des résultats pour orienter les recherches ultérieures. Ce benchmark comprend 129 problèmes couvrant dix domaines, notamment la génétique statistique, la génomique du cancer, le diagnostic clinique et la pharmacogénomique. Les évaluateurs ont estimé que chaque tâche nécessiterait entre 20 et 40 heures de travail pour un expert humain — à un coût estimé à 200 dollars de l’heure —, contre un coût d’inférence par IA de quelques dollars seulement par tâche. Le modèle GPT-5.6 Sol d’OpenAI a atteint un taux de réussite de seulement 28,7 %, passant à 31,5 % en mode Pro — ce qui représente tout de même un bond significatif par rapport au score inférieur à 5 % obtenu par le GPT-5 sur le GeneBench original. Afin d’encourager une évaluation indépendante, OpenAI met en open source dix tâches sur Hugging Face et fournit un sous-ensemble de 50 questions à Artificial Analysis pour des tests de performance réalisés par des tiers.

Améliorez votre expérience client avec Encore.
En savoir plus

Pourquoi Inbenta ?

Grâce à notre solution d'IA composite, votre agent virtuel apprend en permanence de chaque interaction, atteignant une précision supérieure à 99 %.
En savoir plus
Logo Gartners Peer Insights
Basé sur plus de 20 évaluations par des pairs
Service et assistance

Articles connexes publiés cette semaine sur l'IA

Demis Hassabis, PDG de Google DeepMind, réclame la mise en place d'un organisme mondial de surveillance de l'IA avant la fin de l'année
En savoir plus
Apple en pourparlers avec PrismML pour intégrer des modèles d'IA volumineux sur l'iPhone
En savoir plus
Apple poursuit OpenAI pour vol de secrets commerciaux lié aux ambitions du créateur de ChatGPT dans le domaine du matériel informatique
En savoir plus