La ilusión de neutralidad. Una IA neutral es una IA cuyo sesgo coincide con el tuyo

En este artículo

  1. ¿Puede una IA ser neutral, o siempre tiene sesgo?
  2. La cadena que la palabra «neutral» pretende ocultar
  3. Por qué el lenguaje no puede ser neutral
  4. La asimetría perceptiva, o por qué nadie ve su propio sesgo
  5. Todos los ejes, no solo uno
  6. Cuando el sesgo cambia, se vio
  7. Rozado: el sesgo aparece con el RLHF
  8. Perez: parecer opinado vende
  9. La distancia entre opacidad y secreto
  10. La crítica es a la etiqueta, no a la intención

Definiciones · Referencias · También te interesa · En otros sitios

«Esta IA es neutral, solo dice los hechos.» Falso por construcción. Los hechos relevantes los selecciona alguien, el tono los enmarca alguien, el corpus los pondera alguien, el RLHF los pule alguien. Una IA neutral es una IA cuyo sesgo coincide con el tuyo. Cuando descubres una que no, le llamas sesgada. La neutralidad como atributo del producto es el cliché más viejo del marketing tecnológico, y el más eficaz, porque parece descriptivo en lugar de aspiracional.

¿Puede una IA ser neutral, o siempre tiene sesgo?

No puede ser neutral. Antes de que un modelo responda a la primera pregunta, seis decisiones humanas ya han configurado su voz: qué corpus lo entrena, qué filtros se le aplican, qué arquitectura se elige, qué fine-tuning recibe, qué RLHF lo pule y qué system prompt lo acompaña. Cada una de esas decisiones introduce una perspectiva. Una IA «neutral» es, en la práctica, una IA cuyo sesgo coincide con el del usuario que la juzga neutral.

La cadena que la palabra «neutral» pretende ocultar

Antes de que un modelo responda a la primera pregunta de un usuario, han ocurrido al menos seis decisiones humanas que han configurado su voz. Conviene listarlas no como ejercicio académico sino para que la idea de «neutralidad» quede ubicada donde tiene que estar: en la imposibilidad lógica.

Primera decisión: qué corpus se ha usado para el entrenamiento. Composición lingüística, distribución temporal, fuentes incluidas, fuentes ausentes. Eso lo decide un equipo concreto bajo restricciones legales, comerciales y técnicas. Segunda: qué filtros se han aplicado al corpus. Qué se ha quitado, con qué blocklists, con qué criterios de calidad, con qué definición operativa de toxicidad. Tercera: qué arquitectura se ha elegido y con qué hiperparámetros se ha entrenado, lo cual influye en qué tipo de patrones el modelo encuentra más fácilmente. Cuarta: qué fine-tuning específico se ha hecho después del entrenamiento base, con qué corpus específico, con qué peso. Quinta: qué RLHF se ha aplicado, con qué anotadores, con qué definición de respuesta preferible. Sexta: qué system prompt acompaña a cada inferencia, qué moderación post-hoc filtra ciertas salidas, qué reglas duras vetan ciertos temas.

Llamar «neutral» al producto final de esa cadena es como llamar neutral a un editorial de prensa firmado por un autor concreto bajo una línea editorial concreta. La cadena de decisiones puede ser razonable, puede ser cuidadosa, puede aspirar a la imparcialidad. No puede ser neutra. La neutralidad, en sistemas que generan lenguaje, no es un atributo alcanzable. Es un marketing.

Por qué el lenguaje no puede ser neutral

Hay un argumento más profundo, anterior al técnico, que conviene poner en su sitio. El lenguaje no transmite información sobre el mundo desde un punto de vista de ningún lado. Codifica perspectiva. Cuando se dice «trabajadores migrantes» o «inmigrantes ilegales», la información sobre la persona referida es la misma, y la valoración implícita es opuesta. Cuando se dice «régimen» o «gobierno», el contenido factual no varía, y el marco moral cambia. Cuando se dice «libertador» o «caudillo», el sujeto histórico puede ser el mismo, y la lectura cae a uno u otro lado de la frontera.

Esto no es un descubrimiento del análisis crítico contemporáneo. Es lo que cualquier lector atento de Aristóteles, de Maquiavelo, de Orwell o de cualquier manual de retórica clásica encuentra en la primera lección. El lenguaje persuade aunque su autor no quiera persuadir. La selección de términos, el orden de las cláusulas, la jerarquía implícita de qué se menciona primero y qué se considera obvio, son operaciones inevitables, y todas ellas vienen marcadas por la tradición discursiva de la que el hablante procede.

Un LLM que genera lenguaje no escapa a esta condición. La hereda. Cada respuesta tiene una textura léxica, sintáctica y narrativa que es la mediana ponderada del corpus que la entrenó y del fine-tuning que la pulió. Esa mediana es una postura, lo sea consciente o no. Pedir al modelo una respuesta neutral le pide que produzca lo que su entrenamiento le presentó como estilo neutro, y ese estilo neutro es la voz de un grupo concreto en un momento concreto. No hay neutralidad, hay convención cultural sobre qué cuenta como tal.

La asimetría perceptiva, o por qué nadie ve su propio sesgo

Aquí aparece una propiedad cognitiva incómoda que afecta tanto a usuarios como a auditores. Detectamos sesgo cuando difiere del nuestro. Somos ciegos cuando coincide.

Es la versión moderna del viejo proverbio sobre la mota y la viga. Cuando un modelo responde a una pregunta política con una postura que se aparta de lo que el lector considera evidente, el lector la marca como sesgada. Cuando responde con una postura que coincide con la del lector, la marca como objetiva. No es una operación deshonesta. Es la operación por defecto del aparato cognitivo humano, y nos pasa a todos.

La consecuencia operativa es que el discurso público sobre el sesgo de los LLM se mueve por bandazos coyunturales. Cada vez que un modelo concreto produce una respuesta que choca con la sensibilidad de un grupo poderoso, ese grupo denuncia el sesgo, la empresa ajusta, el modelo cambia. Los grupos cuya sensibilidad sí coincidía con la salida del modelo no notaron nada antes y notan el cambio después como si el modelo «hubiera empezado a ser sesgado», cuando lo que ocurre es que el sesgo se ha desplazado en su dirección de chocar.

Todos los ejes, no solo uno

Esto vale para todos los ejes. Vale para la sensibilidad progresista que se quejó de Stable Diffusion generando médicos blancos por defecto. Vale para la sensibilidad conservadora que se quejó de Gemini generando vikingos negros en imágenes históricas. Vale para la sensibilidad nacionalista que se queja de que un modelo no respete su versión del conflicto territorial. En los tres casos, lo que está pasando es lo mismo: el modelo se ha calibrado en una dirección, y los grupos cuyo sesgo coincide con esa dirección no la perciben mientras los grupos cuyo sesgo difiere la denuncian.

La conclusión razonable no es elegir bando. Es entender que la palabra «neutral» en este contexto no nombra una propiedad del modelo. Nombra una coincidencia entre el modelo y el observador.

Cuando el sesgo cambia, se vio

Hay tres casos recientes que conviene traer porque hacen la cadena explícita, contra el deseo de la industria de mantenerla en penumbra.

El primero, el incidente de Gemini con la generación de imágenes históricas en febrero de 2024. El modelo de Google produjo imágenes de soldados nazis racialmente diversos, vikingos negros y papas femeninas en respuesta a peticiones de figuras históricas. La empresa, ante el escándalo, suspendió la generación de personas, reconoció el problema y se disculpó. Lo importante del caso no es el escándalo en sí. Es la admisión implícita: el modelo había sido afinado para introducir diversidad demográfica por defecto en las imágenes, y esa decisión, tomada por un equipo concreto con intenciones identificables, había producido un sesgo opuesto al de la realidad histórica. La «neutralidad» que el modelo presentaba antes era una calibración deliberada. Al cambiar la calibración, el sesgo se hizo visible. Mientras la calibración fue invisible, no había escándalo.

Rozado: el sesgo aparece con el RLHF

El segundo, los trabajos cuantitativos de David Rozado. En The Political Bias of ChatGPT (Social Sciences, 2023) y luego en The Political Preferences of LLMs (PLOS ONE 19(7), 2024, arXiv 2402.01789), Rozado aplicó tests de orientación política estandarizados a un conjunto creciente de modelos. Su conclusión, replicada por terceros, fue que la mayoría de los LLM comerciales responden con un sesgo izquierda-centro en cuestiones políticas estándar. Lo interesante metodológicamente es que los modelos base, antes del RLHF, no mostraban ese sesgo de manera tan marcada. El sesgo, según los datos del estudio, se acentúa durante la fase de alineamiento. No es un artefacto del corpus solo: es un efecto del proceso humano de pulir las salidas.

Perez: parecer opinado vende

El tercero, el trabajo de Perez y otros, Discovering Language Model Behaviors with Model-Written Evaluations (Findings of ACL 2023, arXiv 2212.09251). Mostraron que más RLHF tiende a producir posturas declaradas más fuertes en cuestiones políticas concretas, como el debate sobre armas o sobre inmigración. La hipótesis interpretativa de los autores es interesante: el RLHF empuja al modelo a parecer opinado porque las respuestas opinadas son percibidas como más útiles por los anotadores. La búsqueda de utilidad termina, sin que nadie haya pedido nada parecido, posicionando políticamente al modelo en la dirección de la mediana de sus anotadores.

Los tres casos comparten una estructura. Hay una decisión humana detrás. La decisión tiene una dirección identificable. Cuando esa dirección coincide con la del observador, el modelo se llama neutral. Cuando difiere, se llama sesgado. La palabra «neutral» actúa como pintura encima.

La distancia entre opacidad y secreto

Hay un matiz que conviene introducir antes de cerrar. No toda opacidad es secreto malintencionado. Buena parte de los equipos que afinan modelos comerciales trabajan con criterios que ellos mismos consideran honestos: reducir daño visible, no apoyar discursos extremos, respetar la legalidad de la jurisdicción donde se opera. Decir que su modelo no es neutral no implica que sean tramposos. Implica que el resultado de sus decisiones, sumadas, configura una voz que no es la voz de nadie, pero que comparte códigos identificables con el lugar y la cultura desde la que se opera.

La crítica es a la etiqueta, no a la intención

La crítica seria no es a la intencionalidad. Es a la etiqueta. Si en lugar de vender el producto como «neutral» se vendiera como «modelo afinado por un equipo de Silicon Valley con criterios contemporáneos de moderación occidental», el contrato cognitivo con el usuario sería más limpio. El usuario sabría qué está leyendo. Podría compararlo con otro modelo afinado en otro sitio con otros criterios. Podría usar varios modelos para distintos propósitos. La palabra «neutral», como única etiqueta, cancela esa comparación porque establece al producto como vara de medir el resto, y todo lo que difiera de él aparecerá como desviación.

Por eso la pregunta que importa no es «¿es neutral este modelo?», una pregunta a la que la única respuesta honesta es «no, ningún modelo lo es». La pregunta que importa es «¿el sesgo de quién es el que se me presenta como neutralidad?». Esa segunda pregunta sí tiene respuestas operativas. Tiene nombres de empresas, nombres de equipos, jurisdicciones, marcos culturales. Tiene una geografía. Y mientras esa geografía siga sin nombrarse, la palabra «neutral» seguirá haciendo el trabajo retórico para el que está pensada: invisibilizar a quien firma los pesos.

Crawford, en Atlas of AI (Yale UP, 2021), planteaba la pregunta con un par de capítulos enteros sobre la materialidad política de la IA. Bender y otros, en Stochastic Parrots (FAccT 2021), explicaban por qué la neutralidad en sistemas de lenguaje es un fantasma. O'Neil, en Weapons of Math Destruction (Crown, 2016), había avisado del problema cuando todavía hablábamos de modelos predictivos pequeños. Las tres lecturas convergen en lo mismo. No se trata de eliminar el sesgo, lo cual es lógicamente imposible. Se trata de declararlo, y de declararlo con suficiente precisión para que el usuario pueda evaluar si el sesgo declarado le sirve o no para lo que va a usar el modelo.

Mientras la declaración no exista, la palabra neutral seguirá siendo una de las palabras más caras del marketing tecnológico contemporáneo. La cargas como adjetivo y pagas con la cesión de tu criterio.

Definiciones

Neutralidad (en un sistema generativo). Atributo asignado retóricamente a un modelo cuyas salidas coinciden con las expectativas culturales del observador. No es propiedad técnicamente alcanzable: cualquier modelo que genere lenguaje codifica perspectiva por construcción.

Cadena de decisiones. Secuencia de elecciones humanas que configuran un modelo: composición del corpus, filtros, arquitectura, fine-tuning, RLHF, system prompt, moderación. Cada eslabón tiene firma identificable.

RLHF (reinforcement learning from human feedback). Fase de entrenamiento en la que las salidas se ajustan según preferencias de anotadores humanos. Es uno de los principales determinantes del sesgo final del modelo.

System prompt. Instrucción persistente que precede a las consultas del usuario en cada inferencia. Configura el tono, las restricciones y los criterios de respuesta del modelo. Suele ser secreto.

Asimetría perceptiva. Propiedad cognitiva por la que detectamos sesgo en los demás cuando difiere del nuestro y somos ciegos cuando coincide. Afecta al juicio público sobre los LLM.

Calibración política. Posición agregada de un modelo en pruebas de orientación política estandarizadas. Empíricamente documentada como sensible al proceso de RLHF.

Referencias

Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Marco sobre la materialidad política de los sistemas de IA y la imposibilidad de neutralidad por construcción.

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Argumentación sobre por qué los LLM no pueden ser neutrales en su producción de lenguaje.

O'Neil, C. (2016). Weapons of Math Destruction. Crown. Crítica anticipada al lenguaje de objetividad aplicado a sistemas algorítmicos.

Rozado, D. (2023). The Political Bias of ChatGPT. Social Sciences 12(3), 148. Primer estudio cuantitativo sistemático del sesgo político medible en LLM comerciales.

Rozado, D. (2024). The Political Preferences of LLMs. PLOS ONE 19(7), e0306621. arXiv 2402.01789. Ampliación a veinticuatro modelos con once tests; el sesgo izquierda-centro se observa con consistencia y se acentúa con el RLHF respecto a los modelos base.

Perez, E. et al. (2023). Discovering Language Model Behaviors with Model-Written Evaluations. Findings of ACL 2023. arXiv 2212.09251. Evidencia de que más RLHF acentúa posturas políticas declaradas del modelo.

The Verge, Reuters et al. (febrero 2024). Cobertura del incidente de Gemini con la generación de imágenes históricas. Reportajes que documentan el ajuste deliberado de diversidad y la suspensión posterior de la funcionalidad.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario