En este artículo
- El sesgo que la industria sí audita
- Lo que ningún auditor pone en su informe
- Estilo neutral
- Autores fiables
- Temas polémicos
- Términos legales
- El RLHF como ventana donde el sesgo se decide
- La auditoría como herramienta de normalización
- Estilo, autoridad, criterio. Tres ejemplos donde se ve
- La pregunta política, otra vez
Definiciones · Referencias · También te interesa · En otros sitios
Joy Buolamwini y Timnit Gebru documentaron en Gender Shades (FAccT 2018) que los sistemas comerciales de reconocimiento facial fallaban hasta un 34,7 % en mujeres de piel oscura, frente a apenas un 0,8 % en hombres de piel clara. La industria filtró ese sesgo, en buena medida. Pero los sesgos de un modelo no son los obvios. Esos se publican, se auditan, se mitigan. Los que sostienen el modelo están en la base: qué tipo de prosa se considera neutral, qué autores se citan como fiables, qué temas se marcan como polémicos. No se ven porque están en la decisión sobre qué considerar normal. Los detectores de sesgo detectan el sesgo declarado. El otro sigue intacto, y la auditoría lo deja intacto porque ni siquiera lo está mirando.
El sesgo que la industria sí audita
Hay una historia que la industria cuenta con razonable orgullo, y conviene reconocerla antes de cuestionarla. El campo de fairness in machine learning lleva una década midiendo errores diferenciales por subgrupo demográfico. Gender Shades fue un hito porque tomó tres sistemas comerciales (IBM, Microsoft, Face++), los evaluó sobre una muestra equilibrada por género y por tono de piel, y publicó la matriz de errores. Las diferencias eran groseras y reproducibles. Después del paper, los tres proveedores redujeron sus tasas en pocos meses. La auditoría externa había funcionado.
Desde entonces, los grandes laboratorios mantienen equipos internos que miden disparidades demográficas en sus productos. Se publica una buena parte de los resultados. Se entrena con datos rebalanceados. Se aplican filtros de salida que detectan vocabulario racial o sexista. El campo no es ingenuo y los resultados, en las métricas que mide, son visibles. Un sistema de hoy es razonablemente menos discriminatorio en términos clásicos que uno de hace ocho años.
Esa es la parte que conviene aceptar tal cual antes de discutir el resto. La industria no está negando el problema. Está midiendo lo que sabe medir y mitigando lo que sabe nombrar. La pregunta seria es qué se está dejando de medir.
Lo que ningún auditor pone en su informe
Hay una segunda capa de sesgo que opera más abajo, donde no llegan las métricas de disparidad demográfica. La componen decisiones sobre qué se considera normal. No es un sesgo en el sentido de tratar peor a un grupo identificado. Es una postura, asumida por defecto, que define el centro estilístico, conceptual y referencial del modelo. Y el centro decide, antes que ninguna otra cosa, qué cuenta como pregunta razonable y qué cuenta como respuesta competente.
Cuatro ejemplos para no quedarnos en abstracto.
Estilo neutral
El estilo neutral que el modelo produce por defecto es el de la prosa académica anglosajona contemporánea: frases de longitud media, vocabulario técnico controlado, marcadores discursivos como «however», «importantly», «it is worth noting», desplazados al español como «sin embargo», «es importante señalar», «conviene notar». Cuando se le pide al modelo que escriba «neutralmente», esa es la voz que sale. No es neutralidad, es estilo. Un escritor de habla castellana que escriba con frases largas, con subordinadas, con periodos amplios al estilo de la prosa decimonónica española, será corregido por el modelo como si fuera prolijo. Cervantes pasaría un revisor automático de estilo con una nota muy mala.
Autores fiables
Los autores fiables que el modelo cita son los que aparecen con frecuencia en el corpus. Eso quiere decir las grandes revistas anglosajonas y los textos más citados en inglés. El modelo no cita publicaciones jurídicas españolas, ni revistas filosóficas en alemán fuera de las tres clásicas, ni prensa científica japonesa, ni informes técnicos chinos publicados en Beijing. No es porque haya decidido que son menos fiables. Es porque el corpus le da menos masa para distinguirlas. La consecuencia operativa es la misma: el modelo construye, sin nombrarla, una canónica internacional que coincide casi perfectamente con la que el establishment académico anglosajón considera la suya.
Temas polémicos
Los temas polémicos son los que en la fase de fine-tuning se marcaron como tales. La marca se hizo en una cultura concreta, con criterios concretos, en un momento histórico concreto. Una conversación sobre el aborto provoca, en muchos modelos, una respuesta cuidadosamente equidistante. Una conversación sobre la legitimidad de la monarquía británica no la provoca. Una conversación sobre la rotación de turnos laborales no la provoca. La frontera entre lo polémico y lo neutro no la decide la pregunta. La decide la cultura del laboratorio que entrenó el modelo, y esa cultura es identificable.
Términos legales
Los términos legales que el modelo conoce mejor son los del derecho federal estadounidense. Pregúntale por una figura del derecho mercantil español, del derecho civil francés o del fiqh musulmán, y comparará por debajo de su rendimiento medio. Pregúntale por la Fourth Amendment y responderá con soltura, contextualizándola incluso sin que se lo pidan. No es maldad, es composición del corpus. Pero, operativamente, el modelo cuando «sabe de derecho» sabe mejor de derecho estadounidense, y el usuario no anglosajón recibe un sesgo del que no es informado.
Ninguna de estas cuatro asimetrías aparece en un informe de fairness al uso. Las métricas estándar no las cubren. Y por eso pueden persistir, intactas, debajo de campañas de comunicación que celebran avances reales en otras dimensiones.
El RLHF como ventana donde el sesgo se decide
Hay una fase específica del entrenamiento donde estas decisiones se toman de manera concentrada, y conviene mirarla porque sigue siendo poco discutida. Se llama RLHF, reinforcement learning from human feedback. Después de que el modelo base se ha entrenado sobre el corpus, una segunda fase usa preferencias humanas para alinear las salidas con lo que se considera deseable. Un grupo de anotadores lee respuestas alternativas a la misma pregunta y elige cuál prefiere. El modelo se ajusta para producir más a menudo las respuestas que los anotadores prefirieron.
La pregunta obvia es quién anota. Casper y otros, en Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback (arXiv 2307.15217, 2023, TMLR), publicaron una taxonomía exhaustiva de los problemas estructurales del proceso. Identifican, entre otros, el sesgo del anotador como categoría que no tiene una solución técnica limpia. Los anotadores se contratan donde se puede pagar mano de obra cualificada en inglés a precio competitivo. Esto significa, principalmente, países anglosajones, Filipinas, Kenia, India urbana. La cultura de origen del anotador filtra qué considera «respuesta cortés», «explicación clara», «tono apropiado». Esos juicios entran al modelo como gradientes.
Kirk y otros, en The PRISM Alignment Dataset (NeurIPS 2024 Datasets & Benchmarks, arXiv 2404.16019), llevaron el problema a su prueba empírica más completa. Reclutaron mil quinientos participantes de setenta y cinco países y midieron sistemáticamente cómo sus preferencias diferían sobre las mismas respuestas. Lo encontrado es lo esperable y por eso es escandaloso: las preferencias varían sistemáticamente por demografía. Lo que un anotador estadounidense de clase media universitaria considera respuesta excelente no es lo que un anotador nigeriano de la misma edad considera respuesta excelente. El «default style» del asistente, el tono que el modelo produce por defecto cuando uno no le pide nada concreto, depende de a quién se eligió para enseñarle qué es respuesta excelente.
Esta es la línea donde el sesgo de base se decide, día tras día, anotación tras anotación, sin que aparezca en ningún reporte de fairness porque no se mide como disparidad demográfica del output, sino que se cuela en la definición misma de qué es output bueno.
La auditoría como herramienta de normalización
Cathy O'Neil en Weapons of Math Destruction (Crown, 2016) avisaba de algo que merece relectura a la luz de los LLM: las herramientas algorítmicas no son neutras, y los criterios con los que se las audita tampoco. Una auditoría es una mirada con prioridades, y las prioridades de la auditoría no son las del universo de posibles problemas, son las del consenso de quien audita.
La consecuencia es paradójica. Cuanto más se audita un sistema, más se normalizan los sesgos que la auditoría no detecta. Porque la auditoría produce un documento que dice «sistema verificado», y ese documento desplaza la presión pública hacia otros frentes. Si yo te certifico que mi modelo no discrimina por género o por raza, y omito decir que mi modelo asume implícitamente la prosa anglosajona como neutral, lo que tú lees es «modelo limpio» y dejas de preguntar.
El AI Now Institute, en su Artificial Power: 2025 Landscape Report, señala con dureza el mismo punto. La industria ha tomado el sesgo como un problema técnico que sus equipos internos pueden gestionar con herramientas internas. El problema más amplio, el de quién decide qué se mide y qué no, queda fuera del marco. La concentración de poder en pequeños equipos de fine-tuning y de anotación, todos ellos dentro de una franja cultural muy estrecha del mundo, configura un sesgo de base que ningún auditor está pidiendo nombrar.
Decirlo claro. Una IA «sin sesgos», en el sentido en que la industria usa la palabra, es una IA cuyo sesgo coincide con el del auditor. La auditoría no elimina sesgo; lo homogeneiza. Y la homogeneización tiene un coste que no se contabiliza: las maneras de hablar, de citar, de calificar lo polémico, de definir lo normal, que no encajan con la cultura del auditor, son las que el modelo aprenderá a evitar.
Estilo, autoridad, criterio. Tres ejemplos donde se ve
Hay tres lugares operativos donde el sesgo de base aflora con suficiente claridad para discutirlo sin entrar en abstracción.
Primero, el modelo que redacta «neutral» termina escribiendo con sintaxis anglosajona traducida. Frases cortas, párrafos breves, transiciones explícitas, conclusiones que cierran cada apartado. Eso no es neutralidad, es la voz de los manuales de redacción técnica de Estados Unidos. La prosa española clásica, la francesa académica, la alemana filosófica, la japonesa epistolar, todas ellas son corregidas como prolijas o desorganizadas por un modelo cuyo criterio de «buena escritura» fue calibrado por anotadores con una sola tradición a la espalda. Es un sesgo estilístico mayúsculo, invisible al usuario, normalizado por la auditoría.
Segundo, el modelo que cita siempre las mismas tres revistas lo hace porque el corpus le ha enseñado que esas tres revistas aparecen citadas con frecuencia. Nature, Science, The Lancet. Para el inglés científico, son referencia. Para el español académico, hay docenas de revistas relevantes en cada campo que el modelo no menciona porque su frecuencia en el corpus es marginal. El sesgo de autoridad funciona como retroalimentación: cuanto más cita el modelo a las revistas dominantes, más se publica en ellas, más se citan en otros corpus, más las cita el siguiente modelo. La canonicidad se autorreproduce.
Tercero, el modelo que evita términos legales no estadounidenses no lo evita por orden explícita. Lo evita porque cuando habla de derecho su masa estadística mayor está allí. Y por la lógica de la calibración de confianza, el modelo prefiere territorio firme. La consecuencia es que el usuario español que pregunta sobre prescripción adquisitiva recibirá una respuesta más insegura que el usuario estadounidense que pregunta sobre adverse possession, aunque sean la misma figura jurídica con nombres distintos. Y eso afecta a la toma de decisiones legales reales, ahora que los modelos están entrando en flujos de asesoría profesional sin que el usuario lo sepa siempre.
La pregunta política, otra vez
Bender y otros, en Stochastic Parrots (FAccT 2021), avisaban de esto sin entrar todavía en RLHF a escala industrial. Crawford, en Atlas of AI (Yale UP, 2021), lo enmarcaba como decisión geopolítica disfrazada de elección técnica. Noble, en Algorithms of Oppression (NYU Press, 2018), había documentado el patrón análogo en motores de búsqueda. Las tres lecturas convergen en una observación que conviene fijar.
Cuando se reduce el sesgo a problema técnico, el debate se queda en la superficie. Cuando se reconoce que el sesgo es estructural, derivado de quién compone el corpus, quién filtra, quién anota, quién decide qué considerar normal, el debate se vuelve incómodo porque no tiene solución desde dentro del laboratorio. La solución, si existe, pasa por abrir las decisiones a algo que se parezca a un escrutinio público, y eso es lo último que la industria está dispuesta a aceptar mientras sus ventajas competitivas dependan del secreto.
Mientras eso no ocurra, la cifra interesante a fijar en la pared no es la de las disparidades demográficas medibles, que mejoran. Es la del estrechamiento estilístico, referencial y cultural del modelo medio, que empeora a medida que la industria converge en formación de anotadores, en proveedores de datos sintéticos y en mejores prácticas de alineamiento. Un modelo afinado por anotadores de tres países hablando dos lenguas, según métricas elegidas por equipos de un país, hablando una lengua, es un modelo cuya neutralidad coincide milimétricamente con la voz de ese país y esa lengua. Llamarlo objetivo es una elección retórica. Lo que es es coherente con quién lo hizo.
Definiciones
Sesgo (en ML). Patrón sistemático en las salidas de un modelo que favorece o desfavorece a un grupo, estilo, fuente o marco respecto a otros, sin que esa preferencia esté justificada por la tarea. Se distingue del simple ruido por su persistencia y por su correlación con propiedades del corpus o del proceso de alineamiento.
Disparidad demográfica. Forma medible de sesgo que se evalúa comparando tasas de error o de comportamiento entre subgrupos definidos por variables protegidas (género, raza, edad). Es lo que la auditoría estándar de fairness mide.
Sesgo de base o estructural. Forma menos medible que opera sobre la definición de qué se considera normal o neutral en el modelo: estilo, autoridad, criterio de relevancia. No suele incluirse en los informes de fairness porque no se reduce a comparación entre subgrupos.
RLHF (reinforcement learning from human feedback). Fase de entrenamiento en la que las respuestas del modelo se ajustan a partir de preferencias humanas anotadas. Sus decisiones de fondo (qué es respuesta buena) son culturalmente situadas y se trasladan al modelo.
Anotador. Persona contratada para etiquetar datos o preferencias de respuestas en la fase de RLHF. Su perfil cultural y lingüístico configura el sesgo de calibración del modelo resultante.
Auditoría algorítmica. Procedimiento que evalúa un sistema según métricas definidas para detectar comportamientos discriminatorios o perjudiciales. Eficaz contra los sesgos que las métricas cubren; ciega a los que no.
Normalización por auditoría. Efecto por el que la certificación de un sistema desplaza la presión pública hacia otros frentes, dejando intactos los sesgos no contemplados por la auditoría.
Referencias
Buolamwini, J. & Gebru, T. (2018). Gender Shades. Intersectional Accuracy Disparities in Commercial Gender Classification. FAccT 2018. Auditoría externa de sistemas comerciales de reconocimiento facial y origen del campo de fairness aplicado a comercializaciones.
Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Marco general sobre cómo el corpus traslada sesgos estructurales al modelo.
O'Neil, C. (2016). Weapons of Math Destruction. Crown. Citado por la tesis de que las auditorías reflejan las prioridades de quien las hace y no necesariamente del universo de problemas.
Noble, S. U. (2018). Algorithms of Oppression. How Search Engines Reinforce Racism. NYU Press. Documentación del sesgo agregado en sistemas algorítmicos antes de la era LLM.
Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Marco geopolítico sobre la composición del corpus como decisión política.
Casper, S. et al. (2023). Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback. arXiv 2307.15217 / TMLR. Taxonomía exhaustiva de los fallos estructurales de RLHF, incluido el sesgo del anotador.
Kirk, H. R. et al. (2024). The PRISM Alignment Dataset. NeurIPS 2024 Datasets & Benchmarks. arXiv 2404.16019. Evidencia empírica con mil quinientos anotadores de setenta y cinco países de que las preferencias humanas en RLHF varían sistemáticamente por demografía.
Brennan, K., Kak, A. & Myers West, S. (AI Now Institute) (2025). Artificial Power. 2025 Landscape Report (junio de 2025). Crítica de cómo la industria reduce el sesgo a problema técnico mientras concentra el poder real de decisión en equipos pequeños.
También te interesa
- El dataset como ideología. La elección política más callada del sector
- La ilusión de neutralidad. Una IA neutral es una IA cuyo sesgo coincide con el tuyo
- La IA invisible. La que decide sobre ti sin que sepas que existió la decisión
- Cathy O'Neil y las armas matemáticas

Comentarios0
Todavía no hay comentarios.
Deja un comentario