MMLU, GPQA, HELM, manual para entender los benchmarks de IA

En este artículo

  1. MMLU, el examen general
  2. GPQA, la trampa del doctorado
  3. HumanEval y MBPP, los benchmarks de código que envejecieron
  4. HELM, lo que no aparece en la nota de prensa
  5. Los benchmarks que aún miden algo difícil
  6. Cómo leer una tabla de benchmarks sin tragarse el anuncio
  7. La cuestión política

Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios

Hoy hablamos de los acrónimos que la prensa española copia sin entender. Cada vez que un laboratorio presenta modelo nuevo trae una tabla en su nota de prensa. «92,3% en MMLU. 85,1% en GPQA. 78,4% en HumanEval». Como si fueran notas de selectividad. ¿Qué demonios mide cada una y por qué importa? Reconozco que durante meses repetí esas cifras yo también, en charlas y en artículos, hasta que un colega del MIT me señaló que la mitad estaban saturadas y la otra mitad mal contadas. Es bochornoso, y por eso lo escribo. Crea tu opinión con calma, que esta vez la mía sale con sesgo de converso reciente.

Llevo tres meses con un cuaderno donde apunto, cada vez que veo en un titular una cifra de benchmark, qué benchmark exactamente y cuándo se publicó. La mitad de las cifras vienen de pruebas saturadas hace dos años. Una cuarta parte vienen de pruebas que el propio laboratorio diseñó. La parte restante son datos legítimos. Mantener la distinción, una vez la tienes, es muy fácil. No tenerla es lo normal en la cobertura mediática.

MMLU, el examen general

Massive Multitask Language Understanding es un conjunto de aproximadamente 15.900 preguntas de opción múltiple distribuidas en 57 disciplinas, desde matemáticas elementales hasta jurisprudencia y bioética. Lo publicaron Dan Hendrycks y colaboradores en 2020 (arXiv:2009.03300, presentado en ICLR 2021), y durante varios años fue la referencia central para comparar modelos generales.

La idea era buena. Las preguntas vienen de exámenes reales —tipo SAT, GRE, AP, exámenes médicos, oposiciones— y cubren disciplinas suficientes para que aprobar el conjunto requiera algo parecido a cultura amplia. Cuando GPT-3 salió en 2020 sacaba en torno al 43%. Cuando llegó GPT-4 en marzo de 2023 saltó al 86%. Y entonces vino la saturación.

Saturación, en el argot de evaluación, significa que el techo del benchmark se aproxima al límite de lo que tiene sentido medir. Los modelos frontier de 2025 y 2026 sacan habitualmente entre el 88% y el 92%. La diferencia entre el primer y el quinto modelo —en MMLU— está dentro del margen de ruido provocado por errores en las propias preguntas y respuestas del conjunto. Varios análisis independientes han documentado que MMLU contiene entre un 6% y un 10% de preguntas con respuesta oficial discutible, traducción imprecisa entre conjuntos de validación o ambigüedad genuina del enunciado. A esa cota nadie va a llegar.

MMLU sigue siendo útil como filtro de mínimos. Si un modelo saca menos del 70%, es muy probable que no sirva para casos generales. Si saca más del 85%, está dentro de la familia frontier, y poco más se puede decir sin entrar en otras pruebas.

GPQA, la trampa del doctorado

Graduate-Level Google-Proof Q&A Benchmark, publicado por David Rein y colaboradores en noviembre de 2023 (arXiv:2311.12022), aprieta donde MMLU se afloja. Son 448 preguntas de física, química y biología escritas por candidatos a doctorado en cada campo, validadas por otros expertos, y diseñadas explícitamente para que ni siquiera un profano con acceso a Google pueda resolver buscando. De ahí lo de Google-proof.

El conjunto reducido más usado se llama GPQA Diamond, 198 preguntas filtradas por dificultad y consenso entre validadores. En GPQA Diamond, expertos del propio campo —doctores en física respondiendo preguntas de física— aciertan en torno al 65% en condiciones de tiempo limitado. Es la cota humana razonable. No es 95%, no es 100%, es 65%, porque las preguntas están a propósito en el límite de lo que un humano del campo puede resolver sin recurso a literatura especializada.

Que un modelo saque 70% en GPQA Diamond es serio. Que saque 85% indica capacidad de razonamiento técnico que era ciencia ficción en 2022. Y aun así conviene ver cómo se obtienen las cifras. Los modelos con razonamiento extendido —los que se permiten miles de tokens de cadena de pensamiento antes de responder— pueden tener entre diez y treinta veces más cómputo por pregunta que los modelos rápidos. Comparar el GPQA de un modelo de razonamiento con el de un modelo conversacional sin matizar el régimen de inferencia es comparar peras con plátanos.

A diferencia de MMLU, GPQA aún no está saturado. La diferencia entre el mejor y el quinto modelo del ranking sigue siendo significativa. Por eso se ha vuelto el benchmark de referencia para presentaciones serias en 2025 y 2026.

HumanEval y MBPP, los benchmarks de código que envejecieron

HumanEval lo publicó Mark Chen y el equipo de OpenAI en 2021 (arXiv:2107.03374). Son 164 problemas pequeños donde el modelo recibe la firma de una función Python y un comentario explicando qué tiene que hacer, y tiene que devolver el cuerpo de la función. Se evalúa con tests unitarios automáticos. MBPPMostly Basic Python Problems, Austin et al., arXiv:2108.07732, 2021— es parecido pero más corto: descripciones en lenguaje natural y una función que pase los tests.

Los dos están saturados desde 2024. Los modelos frontier sacan por encima del 90%, y la diferencia entre el primero y el quinto es de pocos puntos. Citarlos hoy en una nota de prensa para presumir es síntoma claro de marketing perezoso. No miente, pero no informa.

Lo que sí mide algo es el sucesor honesto: SWE-bench, presentado por Carlos Jimenez y colaboradores en octubre de 2023 (arXiv:2310.06770, publicado en ICLR 2024). En vez de funciones aisladas, SWE-bench coge issues reales de proyectos open source en GitHub —Django, scikit-learn, sympy, requests— y le pide al modelo que produzca el parche que cierra el issue. Después se evalúa si el parche pasa los tests del proyecto.

La dificultad real del benchmark se ve en el dato fundacional. En la versión original del paper de 2024, GPT-4 resolvía el 1,7% de los issues y Claude 2 el 4,8% usando un retriever oráculo que ya le daba los ficheros correctos a editar. Es decir: en el momento en que MMLU rondaba el 90%, este benchmark devolvía a los mejores modelos de aquel año a la realidad de cifras de un solo dígito. Tres años después, OpenAI publicó una variante curada llamada SWE-bench Verified en agosto de 2024, y en los meses siguientes los modelos frontier de Anthropic y OpenAI han ido subiendo hasta el rango del 70%-77%. Sigue siendo el benchmark de programación más informativo de los que se citan habitualmente.

HELM, lo que no aparece en la nota de prensa

Holistic Evaluation of Language Models no es un benchmark único. Es un meta-marco publicado por Percy Liang y el equipo de Stanford CRFM en noviembre de 2022 (arXiv:2211.09110), después ampliado en sucesivas actualizaciones hasta el HELM Lite y el HELM Classic actuales. La idea de fondo es que evaluar un modelo con una sola métrica es engañoso. HELM evalúa contra docenas de escenarios y devuelve para cada modelo no un número sino un vector: precisión, robustez ante perturbaciones, equidad, sesgo, eficiencia, calibración, toxicidad.

El resultado es incómodo de comunicar. Una nota de prensa puede decir «92,3% en MMLU». No puede decir «6º en precisión general, 4º en robustez, 11º en equidad, 2º en eficiencia». La complejidad de la evaluación HELM es la razón por la que casi nadie la cita en marketing. Y es la razón por la que conviene buscarla cuando uno quiere saber dónde se rompe un modelo en condiciones adversas.

El uso operativo de HELM no es leer el ranking general. Es buscar el modelo que ya se está usando en producción y ver en qué subescenarios se cae. Si la aplicación es traducción al español, mirar el subescenario relevante. Si la aplicación es resumen de texto largo, mirar el subescenario relevante. La granularidad es la utilidad.

Los benchmarks que aún miden algo difícil

Hay dos pruebas más que conviene tener en el radar porque siguen sin saturarse y resisten a la inflación generalizada.

ARC-AGI, propuesto por François Chollet en 2019 como parte de On the Measure of Intelligence (arXiv:1911.01547), es un conjunto de puzles visuales abstractos donde el modelo debe inferir una regla a partir de pocos ejemplos y aplicarla a casos nuevos. Los puzles los puede resolver un niño de ocho años, y aun así durante años los modelos frontier se quedaron en cifras ridículas. En diciembre de 2024, OpenAI anunció que o3 había alcanzado un 75,7% en la evaluación semiprivada con el límite estándar de cómputo de la competición, subiendo al 87,5% con configuración de muy alto cómputo (172x). Ese salto fue noticia legítima. Antes de o3, el récord rondaba el 30%.

Lo que ARC-AGI mide —razonamiento abstracto con pocas pistas— es lo que durante décadas se consideró marca de inteligencia general. Que un modelo lo resuelva consumiendo cómputo masivo no zanja el debate sobre si entiende o sobre si fuerza-bruta. Pero lo desplaza a un terreno mucho más interesante que MMLU.

El otro candidato serio es FrontierMath, propuesto por Elliot Glazer y colaboradores en noviembre de 2024 (arXiv:2411.04872). Son cientos de problemas matemáticos originales, no publicados, escritos por matemáticos del campo, y diseñados para resistir a la memorización. En su lanzamiento, los modelos frontier resolvían menos del 2%. Como GPQA en su momento, FrontierMath aún tiene mucho recorrido por delante.

Cómo leer una tabla de benchmarks sin tragarse el anuncio

Cuando una empresa publica modelo nuevo y enseña tabla, hay tres cosas que conviene revisar antes de fiarse del titular.

La primera es qué benchmark cita y qué benchmark omite. Si el comunicado solo cita los benchmarks donde el modelo gana, hay sesgo de selección. Si cita un conjunto representativo —al menos uno de razonamiento (GPQA), uno de programación realista (SWE-bench Verified), uno multidimensional (HELM o equivalente), uno difícil no saturado (ARC-AGI o FrontierMath)—, hay método detrás. La diferencia entre las dos formas de presentar dice más del lanzador que del modelo.

La segunda es bajo qué régimen de inferencia se midió. Un mismo modelo evaluado con razonamiento extendido y treinta minutos por pregunta puede sacar veinte puntos más que el mismo modelo evaluado en modo conversacional rápido. Comparar resultados entre laboratorios sin igualar el régimen es una comparación tramposa.

La tercera es si el benchmark estaba en los datos de entrenamiento. La contaminación de benchmarks es un problema documentado desde 2022. Los conjuntos de prueba públicos circulan por la web, acaban en los corpus de entrenamiento, y el modelo aprende a responderlos sin aprender a generalizar. Esa es la razón por la que GPQA Diamond se diseñó como Google-proof y por la que FrontierMath mantiene la mayor parte de sus problemas no publicados. La fiabilidad de un benchmark es inversamente proporcional al tiempo que lleva siendo público.

La cuestión política

Esto es opinión personal pero la sostengo con datos. La proliferación de benchmarks favorece al laboratorio grande y perjudica al pequeño. Diseñar un benchmark serio cuesta cientos de miles de dólares en honorarios a especialistas. Evaluar un modelo contra todos los benchmarks relevantes consume cantidades de cómputo que solo los grandes laboratorios pueden permitirse. El resultado es un ecosistema donde quien evalúa, gana, y quien no puede pagar la evaluación queda fuera de la conversación pública.

A esto se suma el incentivo perverso de la financiación. Los rounds de inversión y los acuerdos comerciales se cierran con tablas de benchmarks. Si subir tres puntos en MMLU desbloquea cincuenta millones de capital, el incentivo a optimizar precisamente esos tres puntos —entrenando contra el conjunto, o cerca de él— es enorme. El sector lleva años sabiéndolo y muy pocos actores lo dicen en voz alta porque a casi todos les sale a cuenta el actual statu quo.

Lo que pediría yo a la prensa española —y lo digo sabiendo que la prensa de habla inglesa apenas lo hace mejor— es que cuando reproduzca una cifra de benchmark añada tres datos. Qué benchmark exactamente y de qué año. Bajo qué régimen de inferencia. Cuál era la cifra del segundo competidor. Esos tres datos no harían el artículo menos vendible. Lo harían simplemente útil.

El último estado de saturación documentado, en el AI Index 2026 de Stanford HAI publicado el 8 de abril de 2025, muestra que en MMLU el rango del top-5 mundial cabe en menos de 2,7 puntos porcentuales, mientras que en SWE-bench Verified ese rango supera los 12 puntos y en FrontierMath supera los 18. Esa diferencia entre lo saturado y lo discriminativo es, hoy, la diferencia entre seguir el ruido y leer la señal.

Definiciones

Benchmark saturado: prueba en la que los modelos frontier obtienen puntuaciones tan cercanas al máximo que la diferencia entre ellos no permite distinguir capacidades. MMLU y HumanEval están saturados desde 2024. Cuando un benchmark se satura, conviene cambiarlo por otro más difícil, no insistir.

Cota humana experta: porcentaje de aciertos que personas con formación específica obtienen en el benchmark en condiciones razonables. En GPQA Diamond ronda el 65%. Es la referencia útil; cuando un modelo la supera con margen, está haciendo algo no trivial.

Contaminación de benchmarks: presencia, en los datos de entrenamiento de un modelo, de preguntas o respuestas del propio conjunto de prueba. Si ocurre, el resultado infla artificialmente. Es un riesgo creciente conforme los conjuntos públicos circulan por la web.

Régimen de inferencia: condiciones bajo las que se evalúa un modelo —tokens de razonamiento permitidos, número de intentos, herramientas externas disponibles—. Dos cifras del mismo modelo bajo distintos regímenes no son comparables.

Referencias

Dan Hendrycks et al., Measuring Massive Multitask Language Understanding (arXiv:2009.03300, 2020, presentado en ICLR 2021). Paper original de MMLU.

David Rein et al., GPQA: A Graduate-Level Google-Proof Q&A Benchmark (arXiv:2311.12022, noviembre de 2023). Paper original de GPQA y GPQA Diamond.

Mark Chen et al., Evaluating Large Language Models Trained on Code (arXiv:2107.03374, 2021). Paper original de HumanEval.

Jacob Austin et al., Program Synthesis with Large Language Models (arXiv:2108.07732, 2021). Paper original de MBPP.

Carlos Jimenez et al., SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (arXiv:2310.06770, ICLR 2024). Paper original de SWE-bench y sus variantes posteriores.

Percy Liang et al., Holistic Evaluation of Language Models (arXiv:2211.09110, noviembre de 2022, Stanford CRFM). Paper original de HELM.

François Chollet, On the Measure of Intelligence (arXiv:1911.01547, 2019). Fundamento conceptual y propuesta original de ARC-AGI.

Elliot Glazer et al., FrontierMath: A Benchmark for Advanced Mathematical Reasoning in AI (arXiv:2411.04872, noviembre de 2024). Paper original de FrontierMath.

Stanford HAI, Artificial Intelligence Index Report 2026 (abril de 2025). Fuente del estado de saturación citado.

Para profundizar

Stuart Russell & Peter Norvig, Artificial Intelligence: A Modern Approach (Pearson, 4ª ed., 2020). Capítulo sobre evaluación de sistemas de aprendizaje y problemas clásicos de validación.

Kevin P. Murphy, Probabilistic Machine Learning (MIT Press, 2022). Marco estadístico para entender por qué una métrica única engaña.

OpenAI, Introducing SWE-bench Verified (openai.com, agosto de 2024). Documentación de la variante curada del benchmark.

ARC Prize, ARC Prize 2024: Technical Report (arxiv.org/abs/2412.04604, diciembre de 2024). Documento técnico de la edición 2024 del premio y la actuación de o3.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario