En este artículo
- Cómo funciona, sin trampa
- Lo que MMLU y GPQA no saben medir
- Las grietas del método
- El ranking hoy y lo que dice, y lo que no
- Usar Arena como filtro antes de pagar
- La cuestión política
Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios
Hoy hablamos de Chatbot Arena, la única evaluación de modelos de lenguaje que se parece a la realidad. La tesis es áspera. Cuando la prensa dice «el mejor modelo de IA es X», la pregunta de vuelta debería ser siempre «¿según qué?», y casi nunca se hace. ¿Por qué nos creemos un ranking que nos cuentan sin enseñarnos el medidor? Mi opinión está sesgada porque llevo dos años usando Arena como sanity check antes de pagar suscripciones, y me ha ahorrado dos. Crea la tuya. Vamos a verlo despacio: cómo funciona, por qué importa, qué se le ha caído por el camino y cuándo conviene desconfiar también de Arena.
Reconozco que la primera vez que entré en la web de LMSYS pensé que era un juguete académico. Dos cuadros de texto, dos respuestas anónimas, un botón para votar. No tenía la solemnidad de los benchmarks que la prensa reproducía con cifras a dos decimales. Tardé semanas en darme cuenta de que esa falta de solemnidad era precisamente la virtud. Los benchmarks impresionan; Arena mide.
Cómo funciona, sin trampa
El sistema lo construyó un grupo de investigadores de UC Berkeley dentro de la iniciativa LMSYS, hoy reconvertida en una organización llamada LMArena. La mecánica es sencilla. El usuario entra en la web, escribe una pregunta cualquiera, y dos modelos anónimos —identificados como Modelo A y Modelo B— responden a la vez. El usuario elige cuál de los dos le parece mejor, o declara empate. Solo después de votar se le revela qué modelos eran. Su voto entra en un sistema de puntuación tipo Elo —el mismo del ajedrez, adaptado por Arpad Elo en 1960 para la US Chess Federation— que recalcula el ranking continuamente.
El paper que describe el método con detalle es Chiang et al., Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (arXiv:2403.04132), publicado en marzo de 2024. En ese paper los autores documentan que el sistema había acumulado, en su primer año, más de 240.000 votos sobre decenas de modelos, en más de cien idiomas. A día de hoy la cifra ronda los varios millones. Eso es magnitud suficiente para que el ruido estadístico baje a niveles aceptables, aunque la muestra de votantes siga teniendo los sesgos que veremos más abajo.
Lo importante de la mecánica no es el Elo. Es la doble ceguera. El votante no sabe qué modelos compara. Los modelos no saben quién les vota. Esa ceguera es la que mata —en lo posible— el sesgo de marca. Cuando un periodista escribe que «el nuevo Claude impresiona», está informando sobre el efecto del nombre tanto como sobre el modelo. En Arena el nombre no existe hasta que el voto ya está emitido.
Lo que MMLU y GPQA no saben medir
Los benchmarks técnicos miden cosas concretas, y por eso mismo se quedan cortos. MMLU —Massive Multitask Language Understanding, propuesto por Hendrycks et al. en 2020 (arXiv:2009.03300)— mide la capacidad de responder preguntas tipo examen sobre 57 disciplinas, desde historia hasta medicina. GPQA —Rein et al., arXiv:2311.12022, noviembre de 2023— mide razonamiento de nivel doctorado en física, química y biología; las preguntas se diseñaron para que expertos del campo acertaran y profanos con acceso a Internet fallaran. HumanEval —Chen et al., arXiv:2107.03374, 2021— mide la capacidad de escribir funciones de programación que pasen tests unitarios.
Cada uno mide algo, sí. Pero ninguno mide lo que el usuario hace cuando paga la suscripción. El usuario no examina al modelo en química de doctorado. Le pide que reescriba un correo. Le pide que le explique un concepto. Le pide que resuma un PDF y que después conteste preguntas sobre lo resumido. Le pide que escriba un script corto en Python. Le pide que le ayude a redactar una carta de reclamación al banco. Para todo eso, MMLU no tiene nada que decir.
Chatbot Arena sí. La distribución de tipos de pregunta en Arena reproduce, con sus matices, lo que la gente realmente pide a un modelo. Y la métrica final —¿qué respuesta prefiere un humano viendo las dos a ciegas?— captura la integración de muchas dimensiones a la vez: corrección, tono, longitud adecuada, claridad, ausencia de circunloquios y de avisos innecesarios. No es una métrica analítica. Es agregativa, como casi todas las decisiones que importan.
Stanford HELM —Holistic Evaluation of Language Models, iniciativa de Stanford CRFM— sí intenta una evaluación más amplia que MMLU, con varios escenarios y métricas múltiples por modelo. Pero HELM sigue evaluando contra tareas definidas, no contra preferencia humana real. Lo cual lo hace útil, pero no sustituto.
Las grietas del método
Aquí toca frenar, porque vendí Arena como cura y aún no he hablado de los efectos secundarios.
La primera grieta es demográfica. Los votantes de Arena son entusiastas de IA que han entrado voluntariamente en una web especializada. La muestra está sobrerrepresentada en hablantes de inglés, en hombres, en perfil técnico, en franja horaria de Estados Unidos y Europa. Las propias estimaciones de LMSYS reconocen este sesgo. Si yo soy una abogada en Cádiz que necesita un modelo que escriba bien en español jurídico, Arena me orienta menos de lo que parece.
La segunda grieta es de estilo. El equipo de LMSYS publicó en agosto de 2024 un análisis propio —Does Style Matter? Disentangling Style and Substance in Chatbot Arena— donde reconocían que los votantes premian sistemáticamente respuestas más largas, con encabezados y listas en markdown, frente a respuestas en prosa sobria, incluso cuando la prosa contiene la misma información. Cuando los investigadores controlaban estadísticamente por longitud y formato —regresión Bradley-Terry con variables de estilo—, el ranking se movía. Modelos como Claude 3.5 Sonnet y Llama-3.1-405B subían. GPT-4o-mini y Grok-2-mini bajaban. El dato no invalida Arena. Invalida la lectura simplista del primer puesto.
La tercera grieta es de acceso. En abril de 2025, un grupo de investigadores de Cohere Labs, AI2, Princeton, Stanford, Waterloo y la Universidad de Washington publicó The Leaderboard Illusion (Singh et al., arXiv:2504.20879). Analizaron unas dos millones de batallas y 243 modelos de 42 proveedores, en una ventana de dieciséis meses (enero 2024 a abril 2025). Sus conclusiones fueron incómodas. Google y OpenAI habían recibido, respectivamente, el 19,2% y el 20,4% del total de votos. El conjunto de los 83 modelos de pesos abiertos —de todos los proveedores juntos— acumulaba solo el 29,7%. Además, los grandes laboratorios privados podían probar variantes en privado antes de publicar la que entraría al ranking definitivo. Los autores identificaban 27 variantes privadas que Meta había testado en Arena en los meses previos al lanzamiento de Llama-4. Con suficiente acceso, las ganancias relativas en posición podían llegar al 112%.
Esto último es lo que más me preocupa. No invalida la mecánica de votación a ciegas, que sigue siendo válida en sí misma. Pero degrada la lectura competitiva del leaderboard, porque los modelos no llegan al ring en igualdad de condiciones. Algunos hicieron veintisiete pruebas de calentamiento. Otros, ninguna.
Iba a decir que aun así Arena sigue siendo el menos malo de los rankings. Pero me corrijo, porque «menos malo» es una frase que envejece mal. Lo formularé así: Arena mide algo real (la preferencia humana ciega), con un instrumento imperfecto (la muestra sesgada y el acceso desigual). Cualquier otro ranking mide algo menos real con un instrumento que parece más limpio porque oculta sus juicios de valor dentro del diseño del benchmark.
El ranking hoy y lo que dice, y lo que no
Si uno entra hoy en la web de LMArena, el cuadro superior del leaderboard suele estar ocupado por tres o cuatro nombres que se turnan cada pocas semanas: Anthropic con su línea Claude, Google con Gemini, OpenAI con GPT, y desde 2025 también modelos chinos como DeepSeek y la familia Qwen. La diferencia entre el primero y el quinto en puntuación Elo suele ser, dependiendo de la semana, de entre 20 y 60 puntos. Para hacerse una idea, una diferencia de 100 puntos Elo en ajedrez se traduce en aproximadamente 64% de victorias del más alto sobre el más bajo. Es decir: cuando la prensa titula que «el modelo X arrasa», la realidad estadística suele ser «el modelo X gana seis de cada diez veces contra el segundo».
Esa proporción es la que la cobertura mediática no transmite. Y es la que más cambia la decisión racional del consumidor. Pagar el doble por una mejora del 60% de probabilidad de preferencia frente al 50% del empate puede ser razonable si la tarea es crítica. No lo es si la tarea es escribir un correo.
El ranking además se ramifica por categoría. Hay un Arena general, sí, pero también categorías separadas: programación, instrucciones largas, español, ruso, tareas creativas. Un modelo puede ser primero en general y cuarto en programación. Esa granularidad importa más de lo que parece y casi nadie la consulta.
Usar Arena como filtro antes de pagar
A esto es a lo que vengo, y donde el artículo deja de ser descriptivo para volverse práctico.
Cuando alguien —una empresa de marketing, un divulgador, un comparador— dice que el modelo X es mejor que el Y, lo primero es entrar en LMArena.ai y mirar la diferencia Elo entre los dos. Hay tres umbrales mentales útiles.
Si la diferencia es de menos de 30 puntos Elo, la diferencia es marginal y muy probablemente está dentro del ruido estadístico del sistema. Cualquiera de los dos modelos será indistinguible para el 90% de las tareas. La decisión debería tomarse por precio, por privacidad de los datos, o por integración con el flujo de trabajo. No por calidad.
Si la diferencia es de 30 a 100 puntos, existe una preferencia agregada real pero modesta. Conviene mirar la categoría específica para la tarea concreta. Si yo escribo en español y el modelo líder en español es el segundo del ranking general, debo elegir el segundo, no el primero.
Si la diferencia supera los 100 puntos Elo y se mantiene durante varias semanas, hay una razón sustantiva detrás. Conviene leer qué dice la nota técnica del modelo ganador, y si hay un cambio de arquitectura o de método de entrenamiento.
Y si alguien me vende una diferencia superior a 200 puntos Elo respecto al primer competidor serio, la sospecha por defecto debería ser que está vendiendo humo, o que la comparación está hecha contra un modelo de hace dos generaciones.
La cuestión política
Esto es opinión personal, pero la observo respaldada por la lógica de los incentivos del sector. Importa quién mide y cómo. Importa porque los rankings —Arena incluido— gobiernan las decisiones de compra de las empresas y, por extensión, los flujos de capital hacia los laboratorios. El laboratorio que sube en el ranking levanta ronda. El que baja, ajusta plantilla. Esa traducción inmediata convierte cualquier criterio de evaluación en un instrumento político.
Por eso, cuando un benchmark es propiedad de una empresa que compite en el mismo mercado, hay conflicto de interés estructural. Y por eso, también, una iniciativa académica como LMSYS —ahora LMArena, registrada como organización sin ánimo de lucro en California en 2024— tiene un valor difícil de sustituir, aunque sus métodos sean criticables. Lo que se critica en The Leaderboard Illusion no es la mala fe del equipo de LMSYS, sino la asimetría de acceso que los grandes laboratorios explotan dentro de un sistema diseñado con buena intención.
La respuesta razonable no es desconfiar de Arena. Es desconfiar también de Arena, sumándolo al inventario de instrumentos que conviene leer con la guardia alta. Junto con HELM. Junto con los benchmarks técnicos. Junto con la propia prueba directa del modelo en la tarea que uno tiene entre manos, que sigue siendo la evaluación más fiable que existe.
Lo que no es razonable es lo que hace la prensa española y la mayor parte de la internacional: copiar el primer puesto del ranking como si fuera dogma, sin mirar la diferencia Elo, sin mirar la categoría, sin mirar el sesgo de muestra y sin mencionar que el segundo, en muchos casos, está a tiro de piedra y cuesta la mitad.
Mientras escribo esto, el último análisis disponible —The Leaderboard Illusion, Singh et al., arXiv:2504.20879, abril de 2025— documenta que con acceso preferente al sistema un proveedor podía lograr ganancias relativas de posición de hasta 112%. Esa cifra, más que cualquier conclusión retórica, resume el tamaño de la grieta y la urgencia de mirar siempre detrás del leaderboard.
Definiciones
Sistema Elo: método de puntuación relativa propuesto por Arpad Elo en 1960 para clasificar jugadores de ajedrez de la US Chess Federation. Calcula la puntuación de cada competidor a partir del resultado de sus enfrentamientos directos y de la puntuación del rival; una diferencia de 100 puntos predice aproximadamente un 64% de victorias del más alto.
Benchmark: prueba estandarizada con la que se compara el rendimiento de un modelo en una tarea concreta. MMLU, GPQA y HumanEval son benchmarks. Arena no es un benchmark en sentido estricto, sino un sistema de evaluación por preferencia humana agregada.
Modelo de pesos abiertos: modelo de lenguaje cuyos parámetros entrenados se publican y cualquiera puede descargar, ejecutar y, en muchos casos, modificar. Distinto de modelo de código abierto en sentido estricto, que requiere también publicar datos y código de entrenamiento.
Bradley-Terry: modelo estadístico clásico para estimar la fuerza relativa de competidores a partir de comparaciones pareadas. LMSYS lo usa para controlar variables de estilo (longitud, formato) en sus análisis de robustez del ranking.
Referencias
Wei-Lin Chiang et al., Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (arXiv:2403.04132, marzo de 2024). Paper fundacional del sistema.
Shivalika Singh et al., The Leaderboard Illusion (arXiv:2504.20879, abril de 2025). Crítica empírica al funcionamiento del ranking; documenta las cifras de acceso desigual y el caso de Meta antes de Llama-4.
LMSYS Org, Does Style Matter? Disentangling Style and Substance in Chatbot Arena (blog, agosto de 2024). Análisis interno del propio equipo sobre el sesgo de estilo y la corrección por Bradley-Terry.
Dan Hendrycks et al., Measuring Massive Multitask Language Understanding (arXiv:2009.03300, 2020). Paper original de MMLU.
David Rein et al., GPQA: A Graduate-Level Google-Proof Q&A Benchmark (arXiv:2311.12022, 2023). Paper original de GPQA.
Mark Chen et al., Evaluating Large Language Models Trained on Code (arXiv:2107.03374, 2021). Paper original de HumanEval.
Percy Liang et al., Holistic Evaluation of Language Models (HELM, Stanford CRFM, 2022 en adelante). Iniciativa de evaluación multidimensional alternativa a Arena.
Para profundizar
Arpad E. Elo, The Rating of Chessplayers, Past and Present (Arco Publishing, 1978). Fundamento matemático del sistema de puntuación que Arena adopta.
Brian Christian, The Alignment Problem (Norton, 2020). Contexto sobre por qué evaluar modelos de IA es un problema abierto y no resuelto por benchmarks técnicos.
Stuart Russell & Peter Norvig, Artificial Intelligence: A Modern Approach (Pearson, 4ª ed., 2020). Capítulo sobre evaluación y validación de sistemas de aprendizaje, útil para entender por qué la preferencia humana es difícil de operacionalizar.
Simon Willison, Understanding the recent criticism of the Chatbot Arena (simonwillison.net, 30 de abril de 2025). Lectura ágil y honesta del paper de Cohere Labs y sus implicaciones.
También te interesa
- MMLU, GPQA, HELM, manual para entender los benchmarks de IA
- Medir la inteligencia artificial
- Métricas engañosas. Cuando el examen ya estaba en el material de estudio
- Gemini, Claude, ChatGPT: ¿seguro que tienes que elegir?

Comentarios0
Todavía no hay comentarios.
Deja un comentario