GeneBench-Pro, de OpenAI, pone a prueba a los agentes de IA en el ámbito de la biología computacional
OpenAI ha presentado GeneBench-Pro, un banco de pruebas de investigación diseñado para evaluar si los agentes de IA pueden llevar a cabo el análisis complejo y que requiere un alto grado de criterio que exige la biología computacional en el mundo real. A diferencia de los bancos de pruebas convencionales, centrados en la recuperación de datos objetivos, GeneBench-Pro mide lo que OpenAI denomina «gusto por la investigación»: la secuencia de decisiones que se toman en el análisis científico, desde la interpretación de datos ambiguos hasta la determinación de si los resultados son lo suficientemente sólidos como para servir de base a investigaciones posteriores. El banco de pruebas comprende 129 problemas que abarcan diez ámbitos, entre los que se incluyen la genética estadística, la genómica del cáncer, el diagnóstico clínico y la farmacogenómica. Los evaluadores estimaron que cada tarea requeriría entre 20 y 40 horas de trabajo por parte de un experto humano —a un coste estimado de 200 dólares por hora—, en comparación con los costes de inferencia de la IA, que ascienden a solo unos pocos dólares por tarea. El modelo GPT-5.6 Sol de OpenAI alcanzó una tasa de superación de tan solo el 28,7 %, que aumentó hasta el 31,5 % en el modo Pro —lo que sigue suponiendo un avance significativo respecto a la puntuación inferior al 5 % que obtuvo el GPT-5 en el GeneBench original—. Para fomentar la evaluación independiente, OpenAI ha publicado el código fuente de diez tareas en Hugging Face y ha facilitado un subconjunto de 50 preguntas a Artificial Analysis para que terceros realicen pruebas comparativas.
¿Por qué Inbenta?

