Métricas engañosas. Cuando el examen ya estaba en el material de estudio

En este artículo

  1. El dato que conviene fijar antes de seguir
  2. Qué es la contaminación de datos
  3. Directa, parcial, por paráfrasis
  4. Cuando la medida se convierte en objetivo
  5. Las pruebas no las pone un blog
  6. La asimetría que sostiene el negocio
  7. Por qué nadie audita
  8. La industria del leaderboard
  9. La objeción razonable
  10. Decisiones públicas sobre números falsos
  11. El matiz que no se debe perder
  12. El aburrimiento como frontera del negocio
  13. La frontera del negocio

Definiciones · Referencias · También te interesa · En otros sitios

Un modelo que saca un noventa y cinco en un examen puede ser brillante o puede haber visto el examen antes. Cuando el alumno es un modelo de lenguaje y el examen es un benchmark (prueba estandarizada de evaluación) público, la segunda hipótesis pasa de probable a casi segura. La industria publica el número como logro. El paper que demuestra que estaba en el corpus de entrenamiento se lee en EMNLP y no sale del campus. La discusión técnica es aburrida y por eso nadie la quiere. Por eso es la importante.

El dato que conviene fijar antes de seguir

Hay un par de cifras que vale la pena clavar en la pared al principio, porque después es fácil que la conversación se vuelva abstracta. En el estudio Inference-Time Decontamination. Reusing Leaked Benchmarks for Large Language Model Evaluation (Findings of EMNLP 2024, arXiv 2406.13990), los autores informan de que su técnica reduce la precisión inflada un 22,9 por ciento en GSM8K y un 19,0 por ciento en MMLU. Es decir, una parte sustancial de la cifra que la industria publica como rendimiento puede explicarse por ejemplos que el modelo ya había visto durante el entrenamiento.

Léase otra vez.

Buena parte del rendimiento que celebramos no es capacidad del modelo. Es memoria de lo que ya había visto. No es una estimación a ojo, no es una sospecha de crítico ácido. Es la diferencia que mide el paper entre lo que un modelo responde cuando la pregunta forma parte de su corpus de entrenamiento y lo que responde cuando se le quita ese atajo.

Qué es la contaminación de datos

El nombre técnico del problema es contaminación de datos (en inglés data contamination, también llamada data leakage cuando se enfoca como filtración del conjunto de prueba al de entrenamiento). La encuesta más completa publicada hasta la fecha, Benchmark Data Contamination of Large Language Models. A Survey de Xu y otros (arXiv 2406.04244, 2024), distingue varias formas.

Directa, parcial, por paráfrasis

La más obvia es la directa. El conjunto de evaluación, o partes de él, aparece literalmente en el corpus de entrenamiento. Es lo que un humano llamaría hacer trampa, aunque rara vez sea deliberado.

La parcial. Aparecen ejemplos individuales, fragmentos, soluciones discutidas en foros, trozos del enunciado mezclados con código de otros usuarios.

Y la indirecta o por paráfrasis. El corpus contiene reformulaciones, traducciones, comentarios en blogs, repositorios con explicaciones del problema, artículos académicos que citan el ítem. Esta última es la más difícil de detectar y la más generalizada, porque cualquier benchmark suficientemente importante genera un ecosistema textual a su alrededor en cuestión de meses. Quien construye el modelo no está obligado a hacer trampa para que la trampa ocurra. Basta con no filtrar el corpus. Y los corpus a escala web son imposibles de filtrar exhaustivamente.

La contaminación es el estado por defecto. La descontaminación es la excepción cara que casi nadie paga.

Cuando la medida se convierte en objetivo

Hay aquí un mecanismo más antiguo que la IA. Lo formuló Marilyn Strathern en 1997, en Improving ratings. Audit in the British University system, generalizando una observación previa de Charles Goodhart, que en 1975 había escrito que cualquier regularidad estadística observada tiende a colapsar en cuanto se ejerce presión sobre ella con fines de control. La frase que ha hecho fortuna, más simple, es de Strathern. Cuando una medida se convierte en objetivo, deja de ser una buena medida.

En IA la dinámica se cumple con una nitidez incómoda.

MMLU (Massive Multitask Language Understanding, una batería que cubre cincuenta y siete áreas distintas) se publica en 2020 como prueba multitarea, lo bastante variada y lo bastante difícil como para ser una vara útil. Cinco años después, MMLU es objetivo declarado de los entrenamientos. Los modelos se evalúan, se ajustan y se vuelven a evaluar contra él hasta que el número sale. SWE-bench, otro benchmark importante construido sobre tickets reales de GitHub, sigue el mismo recorrido. Nace como diagnóstico de capacidad. Se convierte en KPI (indicador clave) de trimestre. Y, en el proceso, deja de ser diagnóstico para convertirse en producto.

Lo que mide ya no es lo que el modelo puede hacer en programación real. Es lo que el modelo puede hacer sobre la muestra fija que la industria entera ha leído, comentado, citado y reentrenado.

Las pruebas no las pone un blog

Quien quiera comprobarlo no necesita confiar en la voz de quien escribe esto. Gary Marcus, uno de los críticos más insistentes del campo, vuelve sobre el problema en su boletín Marcus on AI, fuera del paper académico, en formato legible para quien no quiera pelearse con la tabla 4 del appendix. Leak, Cheat, Repeat. Data Contamination and Evaluation Malpractices in Closed-Source LLMs documenta el problema en modelos cerrados, donde la auditoría externa es imposible por definición porque el corpus no se publica. LessLeak-Bench. A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks (arXiv 2502.06215) hace el mismo ejercicio sobre ochenta y tres benchmarks de ingeniería del software. Su hallazgo es más fino de lo que conviene a un titular alarmista. En promedio la filtración es baja, en torno al 4,8 por ciento en Python, al 2,8 en Java y al 0,7 en C/C++. Pero hay casos extremos: QuixBugs filtrado al cien por cien, BigCloneBench más de la mitad. Y donde la filtración aparece, infla de forma brutal: en el benchmark APPS, StarCoder-7B obtiene una puntuación casi cinco veces mayor sobre los ejemplos filtrados que sobre los limpios. Cheng, Chang y Wu (A Survey on Data Contamination for Large Language Models, arXiv 2502.14425) repasan el panorama un año después de Xu, y la imagen no mejora. Las técnicas de detección avanzan. Los modelos avanzan más rápido. Los corpus crecen. El equilibrio sigue inclinado del lado de la contaminación.

El argumento técnico, en frío, es de manual. Lo interesante es lo que pasa cuando se mira el dispositivo completo de incentivos.

La asimetría que sostiene el negocio

El laboratorio que entrena un modelo conoce su corpus. No del todo, porque a escala web nadie conoce su corpus del todo, pero lo conoce mucho mejor que cualquier evaluador externo.

Por qué nadie audita

Si quisiera auditarse, podría. Podría hacer pruebas de inferencia de pertenencia (membership inference, la técnica que estima si un ejemplo concreto formó parte del entrenamiento). Podría descontaminar contra los benchmarks conocidos. Podría reentrenar excluyendo dominios concretos y reportar la caída de rendimiento. Algunos lo hacen parcialmente. La mayoría no.

Por qué iban a hacerlo.

La auditoría no la pide el comprador, porque el comprador no sabe que existe la auditoría. No la pide el regulador, porque el regulador trabaja con la cifra publicada. No la pide el inversor, porque el inversor quiere ver el número del trimestre subir. No la pide la prensa, porque la prensa titula con el porcentaje grande y no con el porcentaje real descontaminado. Quien tendría que pedirla es la comunidad académica, que efectivamente la pide, y por eso publica los papers que nadie fuera del campo lee.

El sistema funciona porque la asimetría informativa es funcional al negocio. Llamarlo accidente es una cortesía que el negocio no se ha ganado.

La industria del leaderboard

Hay un agravante. El leaderboard (tabla pública de clasificación que ordena modelos por su puntuación en un benchmark). Los rankings del trimestre, las comparativas semanales en Twitter, los hilos en Hacker News, las gráficas que muestran cómo el modelo X supera al Y por seis décimas en MMLU.

La industria del leaderboard recompensa el sobrentrenamiento al test con una eficacia brutal, porque la diferencia entre el primero y el segundo puesto del ranking semanal traduce en inversión, en contratos, en portada de TechCrunch. El equipo que decida no optimizar contra el benchmark, por razones de pureza metodológica, pierde la inversión. El que optimice, gana.

La selección natural del campo está alineada contra la honestidad métrica. No porque los investigadores sean deshonestos. Porque la estructura de incentivos premia un tipo concreto de práctica y castiga el otro. Lo que sale al final es lo que el sistema selecciona.

La objeción razonable

Dirá alguien que la contaminación es un problema técnico conocido, que se está trabajando en él, que existen benchmarks dinámicos, conjuntos de validación privados, evaluaciones en vivo, pruebas con datos generados ex profeso después del cutoff (fecha de corte del corpus de entrenamiento) del modelo. Es verdad y es relevante.

También es verdad que esas técnicas avanzadas se aplican a una minoría de las evaluaciones que aparecen en los kits de prensa, y que el público general consume las cifras de MMLU, GSM8K y compañía sin asterisco. La existencia de buenas prácticas en los márgenes no rescata al grueso de los números que sostienen el discurso público sobre IA.

Es una situación parecida a la nutrición de los noventa. Había nutricionistas que entendían la diferencia entre grasa saturada e insaturada, y había envases que ponían «light» en grande. Lo que llegó al consumidor fue el envase.

Decisiones públicas sobre números falsos

Si las métricas están infladas, la industria lo sabe y los reguladores no lo entienden, las decisiones de adopción y regulación se toman sobre números falsos. No sobre números aproximados, ni sobre números optimistas. Sobre números que tienen un sesgo conocido en una dirección conocida y de magnitud estimada en torno al veinte por ciento en algunas pruebas, según los papers ya citados.

Cuando una administración pública decide adoptar un modelo para tramitación de expedientes basándose en su rendimiento en un benchmark, está decidiendo sobre un dato del que una parte apreciable, en grueso, es ruido de memorización. Cuando un consejo regulador discute si imponer obligaciones particulares a modelos «de frontera», y la frontera se define por umbral de capacidad medido en estos mismos benchmarks, está dibujando la frontera con un instrumento que la industria ha aprendido a engañar.

El resultado no es una mala medición. Es una mala política derivada de una mala medición.

El matiz que no se debe perder

Conviene insistir en un punto que es fácil malinterpretar. No se está diciendo que los modelos sean tontos ni que sus capacidades sean nulas. Hacen cosas que hace cinco años parecían ciencia ficción, y este blog no va a sumarse al revisionismo cómodo que niega la realidad para evitar el ruido.

Se está diciendo otra cosa. Que la medida que la industria publica para cuantificar esas capacidades está sistemáticamente inflada. Que la inflación no es ruido aleatorio sino sesgo en una dirección. Que la dirección es siempre la que favorece la cifra que sale en prensa.

El modelo es bueno. La medida está rota. Las dos frases pueden ser verdad a la vez. Normalmente lo son.

El aburrimiento como frontera del negocio

Queda una pregunta menos académica y más sucia. Por qué la discusión técnica de la contaminación de benchmarks es tan aburrida que prácticamente nadie fuera del campo la quiere.

Porque está construida para serlo.

La frontera del negocio

Porque entender de verdad lo que mide MMLU exige paciencia, conocimiento estadístico, lectura paralela de varios papers y disposición a no quedarse con la versión simple. Porque la versión simple, la del porcentaje grande, está optimizada para entrar por el oído. Porque el que quiere venderle algo al lector necesita que el lector no haga preguntas, y el aburrimiento es el método más eficaz para que no las haga.

La frontera del negocio no está en la prestación. Está en el aburrimiento programado de quien tendría que auditar la prestación. Por eso la asimetría es estable. Por eso vive ahí el dinero.

Un modelo que saca noventa y cinco en un examen filtrado y noventa y cinco en un examen limpio sería una buena noticia. Un modelo que saca noventa y cinco en el filtrado y setenta y cinco en el limpio es otra cosa muy distinta, y la industria publica el primer número sin aclarar si ha verificado siquiera la diferencia. El examen ya estaba en el material de estudio. El número está en la nota de prensa. La diferencia entre las dos frases es la única cosa relevante de este texto, y la única que no va a aparecer en ningún titular sobre el modelo del trimestre que viene.

Definiciones

Benchmark. Prueba estandarizada que mide alguna capacidad de un modelo sobre un conjunto fijo de ejemplos, normalmente público. MMLU, GSM8K, APPS y SWE-bench son benchmarks de uso común para evaluar modelos de lenguaje.

Contaminación de datos (data contamination). Situación en la que ejemplos del conjunto de evaluación, o información derivada de ellos, han estado presentes en el corpus con el que se entrenó el modelo. Inflada la puntuación del modelo respecto a lo que rendiría sobre ejemplos verdaderamente nuevos.

Filtración de datos (data leakage). Caso particular de contaminación en el que la información que debía estar reservada al conjunto de prueba se filtra al de entrenamiento, sea de forma literal o por paráfrasis.

Descontaminación. Conjunto de técnicas que detectan y retiran del corpus de entrenamiento, o de la evaluación, los ejemplos contaminados. Cuando se aplica en el momento de evaluar y no antes de entrenar se llama descontaminación en tiempo de inferencia.

Inferencia de pertenencia (membership inference). Técnica que estima, a partir del comportamiento de un modelo ante un ejemplo, si ese ejemplo formó parte de su conjunto de entrenamiento. Es una de las herramientas principales para auditar contaminación en modelos cerrados.

Ley de Goodhart. Principio según el cual una medida deja de ser fiable en cuanto se convierte en el objetivo que orienta el sistema medido. La formulación moderna se atribuye a Marilyn Strathern en 1997.

Leaderboard. Tabla pública de clasificación que ordena modelos según su puntuación en uno o varios benchmarks. Funciona como mecanismo de visibilidad y, en la práctica, de asignación de capital.

Cutoff. Fecha límite del corpus de entrenamiento de un modelo. Los ejemplos generados después de esa fecha quedan, en principio, fuera del corpus, lo que los hace candidatos a evaluaciones más limpias.

Referencias

Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models. A Survey. arXiv 2406.04244. Encuesta general del problema, tipologías de contaminación y técnicas de detección. Fuente principal del cuerpo del artículo.

Inference-Time Decontamination. Reusing Leaked Benchmarks for Large Language Model Evaluation. Findings of EMNLP 2024 (arXiv 2406.13990). El resumen del estudio informa de que su técnica reduce la precisión inflada un 22,9 % en GSM8K y un 19,0 % en MMLU; de ahí proceden esas dos cifras del cuerpo.

Balloccu, S., Schmidtová, P., Lango, M. y Dušek, O. (2024). Leak, Cheat, Repeat. Data Contamination and Evaluation Malpractices in Closed-Source LLMs. EACL 2024, ACL Anthology 2024.eacl-long.5 (arXiv 2402.03927). Documentación del problema en modelos comerciales cerrados, donde no se publica corpus de entrenamiento.

LessLeak-Bench. A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks. arXiv 2502.06215. Investigación sistemática de filtración en ochenta y tres benchmarks de ingeniería del software. Su resumen reporta ratios medios de filtración del 4,8 % en Python, 2,8 % en Java y 0,7 % en C/C++, y casos extremos como QuixBugs (100 %) y BigCloneBench (55,7 %). El texto del artículo recoge además que StarCoder-7B obtiene en APPS un Pass@1 4,9 veces mayor sobre los ejemplos filtrados que sobre los limpios.

Cheng, Y., Chang, Y. y Wu, Y. (2025). A Survey on Data Contamination for Large Language Models. arXiv 2502.14425. Revisión posterior a Xu, citada para mostrar que el panorama no ha mejorado pese a los avances en detección.

Strathern, M. (1997). Improving ratings. Audit in the British University system. European Review 5, 305–321. En la página 308 recoge la formulación que ha hecho fortuna de la ley de Goodhart, «cuando una medida se convierte en objetivo, deja de ser una buena medida», citada como marco para entender por qué los benchmarks se degradan al convertirse en objetivo.

Goodhart, C. (1975). Problems of Monetary Management. The U.K. Experience. Papers in Monetary Economics, Reserve Bank of Australia. Trabajo de política monetaria del que la observación original deriva en ley homónima, generalizada después por Strathern. Citado como antecedente del principio aplicado a los benchmarks.

Marcus, G. Marcus on AI. Boletín del autor en Substack, citado como ejemplo de divulgación crítica accesible fuera del paper académico.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario