GeneBench-Pro, de OpenAI, pone a prueba a los agentes de IA en el ámbito de la biología computacional

7 de julio de 2026
Automatiza las experiencias conversacionales con IA
Descubre el poder de una plataforma que te proporciona el control y la flexibilidad necesarios para ofrecer experiencias de cliente valiosas a escala.
Programa una demostración

OpenAI ha presentado GeneBench-Pro, un banco de pruebas de investigación diseñado para evaluar si los agentes de IA pueden llevar a cabo el análisis complejo y que requiere un alto grado de criterio que exige la biología computacional en el mundo real. A diferencia de los bancos de pruebas convencionales, centrados en la recuperación de datos objetivos, GeneBench-Pro mide lo que OpenAI denomina «gusto por la investigación»: la secuencia de decisiones que se toman en el análisis científico, desde la interpretación de datos ambiguos hasta la determinación de si los resultados son lo suficientemente sólidos como para servir de base a investigaciones posteriores. El banco de pruebas comprende 129 problemas que abarcan diez ámbitos, entre los que se incluyen la genética estadística, la genómica del cáncer, el diagnóstico clínico y la farmacogenómica. Los evaluadores estimaron que cada tarea requeriría entre 20 y 40 horas de trabajo por parte de un experto humano —a un coste estimado de 200 dólares por hora—, en comparación con los costes de inferencia de la IA, que ascienden a solo unos pocos dólares por tarea. El modelo GPT-5.6 Sol de OpenAI alcanzó una tasa de superación de tan solo el 28,7 %, que aumentó hasta el 31,5 % en el modo Pro —lo que sigue suponiendo un avance significativo respecto a la puntuación inferior al 5 % que obtuvo el GPT-5 en el GeneBench original—. Para fomentar la evaluación independiente, OpenAI ha publicado el código fuente de diez tareas en Hugging Face y ha facilitado un subconjunto de 50 preguntas a Artificial Analysis para que terceros realicen pruebas comparativas.

Mejora tu experiencia de cliente con Encore.
Más información

¿Por qué Inbenta?

Con nuestra solución Composite AI, su agente virtual aprende continuamente de cada interacción, alcanzando una precisión superior al 99 %.
Más información
Logotipo de Peer Insights de Gartner
Basado en más de 20 revisiones por pares.
Servicio y asistencia

Publicaciones relacionadas de AI This Week

El director general de Google DeepMind, Demis Hassabis, exige que un organismo regulador mundial de la IA esté operativo antes de que termine el año
Leer más
Apple está en conversaciones con PrismML para integrar modelos de IA de gran tamaño en el iPhone
Leer más
Apple demanda a OpenAI por robo de secretos comerciales relacionado con las ambiciones en materia de hardware del creador de ChatGPT
Leer más