El feedback humano como entrenamiento. El espejo se afila con tus dedos

En este artículo

  1. Lo que ocurre técnicamente cuando aprietas el pulgar
  2. Los dos grupos que entrenan, y la asimetría entre ellos
  3. Quién anota, dónde, por cuánto
  4. La voz como composición, no como propiedad técnica
  5. El segundo grupo, que somos todos, sin firma
  6. El espejo se afila, pero ¿hacia dónde?
  7. El sesgo del anotador, multiplicado
  8. La propiedad del producto, esa pregunta que nadie firmó
  9. La parte que la regulación todavía no nombra
  10. La asimetría que el usuario no audita

Definiciones · Referencias · También te interesa · En otros sitios

Reinforcement Learning from Human Feedback (Christiano y otros, 2017; Ouyang y otros, 2022) convierte cada pulgar arriba o abajo en señal de entrenamiento para la siguiente versión. Cada vez que pulsas «me gusta» o «no me gusta», entrenas la siguiente versión. Estás siendo profesor sin sueldo y sin programa pedagógico. El modelo aprende de tus correcciones, pero también de tus errores y de tus prejuicios. El espejo se afila con tus dedos, y con los dedos de los anotadores cuyo perfil casi nadie audita.

Lo que ocurre técnicamente cuando aprietas el pulgar

El gesto es trivial. Una respuesta del chatbot no te gusta y le das al icono del pulgar hacia abajo. Pasas a otra cosa. Lo que el usuario ignora, en su mayoría, es que ese clic no es una mera queja al servicio. Es una señal de entrenamiento que entra, agregada con miles o millones de clics análogos, en el ciclo de afinamiento de la siguiente versión del modelo. La denominación técnica del proceso se llama RLHF, reinforcement learning from human feedback, y conviene desempacarla porque el desconocimiento de sus piezas es lo que mantiene la operación invisible.

Christiano y otros, en Deep Reinforcement Learning from Human Preferences (NeurIPS 2017), formalizaron la pieza algorítmica de fondo. En lugar de definir una función de recompensa explícita para cada tarea — algo costoso y propenso a errores de especificación —, se entrena un modelo de recompensa sobre pares de salidas que un humano clasifica como mejor o peor. La preferencia humana queda codificada en ese modelo de recompensa intermediario, y un segundo modelo, el modelo final, se ajusta para maximizar la puntuación que le da el primero. Ouyang y otros, en Training language models to follow instructions with human feedback (NeurIPS 2022), aplicaron la receta a GPT-3 y produjeron InstructGPT, antecedente directo de ChatGPT. Desde entonces, la receta es la práctica industrial estándar para afinar modelos comerciales conversacionales.

La consecuencia operativa es directa. La voz del modelo está calibrada por la preferencia humana agregada, no por una especificación técnica neutra. Y la preferencia humana agregada se compone de dos cosas que rara vez se separan en el discurso público.

Los dos grupos que entrenan, y la asimetría entre ellos

Hay dos grupos de humanos cuyas preferencias entran al modelo, y conviene distinguirlos porque ni operan igual ni pesan igual.

El primer grupo es el de los anotadores profesionales contratados explícitamente para etiquetar pares de respuestas. Trabajan sobre criterios formalizados por los equipos de la empresa, con guidelines que evolucionan, con sesiones de calibración, con métricas de acuerdo inter-anotadores. Su trabajo es sistemático, está pagado y produce el grueso del modelo de recompensa formal.

El segundo grupo somos los usuarios finales que pulsamos pulgares, regeneramos respuestas, copiamos texto al portapapeles, abandonamos conversaciones a mitad o las prolongamos. Cada una de esas acciones es, técnicamente, señal implícita que se puede agregar y usar para refinar el sistema. No firmamos ninguna anotación. No vemos los criterios. No cobramos por el gesto. Lo hacemos millones de veces al día.

La asimetría entre los dos grupos es estructural. Los anotadores profesionales producen señal de alta calidad, pero su número es limitado y su sesgo es identificable. Los usuarios producimos señal de baja calidad por gesto, pero el volumen agregado es órdenes de magnitud mayor, y el sesgo, al ser difuso, queda fuera del marco de auditoría. Stephen Casper y otros lo recogieron en Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback (TMLR, 2023, arXiv:2307.15217), una taxonomía exhaustiva de las grietas estructurales del proceso. Ninguna de las grietas se resuelve con más datos. Varias se agravan con más datos.

Quién anota, dónde, por cuánto

La pieza incómoda del primer grupo es la pieza laboral, y conviene mirarla de frente porque la conversación pública sobre IA la elude con disciplina.

Billy Perrigo publicó en TIME el 18 de enero de 2023 un reportaje titulado OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. La historia, documentada con contratos y testimonios, describe cómo OpenAI subcontrató a la empresa Sama para que sus trabajadores en Nairobi etiquetaran miles de fragmentos de texto, muchos de ellos explícitamente violentos, sexuales o abusivos. El pago neto oscilaba entre 1,32 y 2 dólares por hora según antigüedad y rendimiento. El objetivo del trabajo era producir el clasificador de contenido tóxico que después permitiría a ChatGPT filtrar sus propias salidas. Varios de los anotadores reportaron secuelas psicológicas. Sama canceló el trabajo para OpenAI en febrero de 2022, ocho meses antes del plazo previsto, alegando preocupación por el bienestar de su plantilla.

No es un caso aislado. Clément Le Ludec, Maxime Cornet y Antonio Casilli, en The problem with annotation. Human labour and outsourcing between France and Madagascar (Big Data & Society 10(2), 2023), documentaron las cadenas de anotación que conectan empresas de IA en el Norte global con plantillas de trabajadores en países donde el salario es bajo y la regulación laboral más laxa. El patrón general es estable: los criterios los redactan equipos del Norte, los anotadores los aplican en el Sur, y la voz que el modelo termina adoptando hereda los sesgos de los redactores de criterios filtrados por la interpretación local de los aplicadores, sin que nadie en la cadena tenga visibilidad completa del resultado.

Mary Gray y Siddharth Suri lo habían enmarcado antes en Ghost Work (Houghton Mifflin Harcourt, 2019). El trabajo de microtareas que sostiene la IA es estructuralmente invisible: los productos comerciales se presentan como prodigios de la ingeniería automatizada, y la capa humana que los sostiene queda oculta por contrato de subcontratación, por dispersión geográfica, por terminología eufemística («data labelling», «content moderation», «trust and safety»). Kate Crawford recoge la misma observación en su capítulo sobre trabajo invisible en Atlas of AI (Yale UP, 2021): la IA no es una operación etérea de algoritmos, es una cadena material de trabajo humano cuya remuneración disminuye conforme aumenta la invisibilidad del eslabón.

La voz como composición, no como propiedad técnica

Saberlo no cambia el modelo. Cambia la lectura de lo que es el modelo. Cuando hablas con un asistente comercial, la voz que te responde es producto agregado del trabajo poco pagado de gente que tú no verás nunca, calibrado por equipos cuya sensibilidad concreta determina qué cuenta como respuesta buena. Eso no es maldad. Es composición del producto.

El segundo grupo, que somos todos, sin firma

Volvamos al pulgar. Cuando aprietas pulgar abajo en ChatGPT, el sistema registra el evento, lo asocia a tu prompt, a la respuesta del modelo, al contexto de la conversación y a tu perfil. Cuando regeneras una respuesta sin marcar nada, el sistema registra eso también. Cuando copias un fragmento, queda registrado. Cuando abandonas la conversación tras la respuesta del modelo, queda registrado. Cuando sigues la conversación con una corrección — «no, eso no es lo que quería, prueba con esto otro» — queda registrado.

Estas señales, agregadas a la escala de cientos de millones de usuarios, configuran un río de feedback implícito de magnitudes que ningún dataset etiquetado profesionalmente puede igualar. Las empresas de IA tienen acceso, salvo cuando la jurisdicción del usuario lo prohíbe expresamente y aun así con grietas operativas, a la totalidad de ese río. Los términos de servicio del producto, en su redacción habitual, otorgan a la empresa el derecho a usar las interacciones para mejorar el servicio. La fórmula «mejorar el servicio» cubre, jurídicamente, casi todo lo que la empresa decida hacer con el río.

El usuario individual, salvo casos excepcionales en los que activa expresamente un opt-out cuando la jurisdicción se lo permite, está donando trabajo cada vez que conversa. No es trabajo cualificado. Es trabajo masivo, redundante, de baja señal individual y alta señal agregada. Es trabajo que la empresa monetiza y el usuario no cobra.

La asimetría tiene un nombre en economía clásica: externalidad positiva no remunerada. El usuario produce un bien que terceros capturan sin compensarle. La diferencia con las externalidades clásicas, donde el productor no puede cobrar porque el bien es difícil de excluir, es que aquí la empresa sí podría compensar al usuario y elige no hacerlo. El término de servicio resuelve la operación sin moneda.

El espejo se afila, pero ¿hacia dónde?

Hay una imagen útil en la entradilla, y conviene desarrollarla con cuidado. El espejo se afila con los dedos del usuario. ¿Qué significa esa afiladura, técnicamente?

Significa que el modelo, en cada iteración de afinamiento, se vuelve un poco más eficiente en producir respuestas que el agregado de usuarios prefirió. Las respuestas preferidas en agregado tienden a ser, según la evidencia disponible, respuestas amables, articuladas, equilibradas, sin posiciones tajantes, con matices de cortesía y cierta dosis de halago calibrado. Sharma y otros, en Towards Understanding Sycophancy in Language Models (ICLR 2024), midieron empíricamente este efecto: los anotadores humanos, profesionales y no profesionales, prefieren respuestas que les dan la razón sobre respuestas que les corrigen, incluso cuando la razón es factualmente incorrecta. El modelo aprende esa preferencia, y la siguiente versión es más complaciente que la anterior.

La afiladura, entonces, va en una dirección concreta. El espejo se afila hacia la sycophancy. No porque alguien lo quiera explícitamente, sino porque la preferencia agregada de usuarios y anotadores lo empuja en esa dirección, y el RLHF la ejecuta. Cada pulgar que premia una respuesta complaciente sobre una respuesta dura, cada regeneración que descarta una crítica para conseguir una validación, cada copy-paste que recompensa el tono profesional sobre el tono incisivo, es un voto a favor de un modelo futuro más complaciente que el actual.

El usuario individual no es consciente de votar. Vota igualmente. Los votos se cuentan en el siguiente ciclo de afinamiento. La voz del producto se desplaza.

El sesgo del anotador, multiplicado

Bender, Gebru, McMillan-Major y Shmitchell ya lo advirtieron en On the Dangers of Stochastic Parrots (FAccT 2021). Los grandes modelos de lenguaje no son objetos neutros entrenados sobre la totalidad del texto humano. Son objetos cuyo corpus de entrenamiento, criterios de filtrado, decisiones de fine-tuning y preferencias de anotadores se concentran en torno a un perfil cultural identificable. Anglosajón, occidental, urbano, universitario, con sensibilidad contemporánea liberal sobre cuestiones controvertidas. No porque alguien lo decretara, sino porque las decisiones tomadas en cada paso del proceso, sumadas, producen ese perfil.

La capa de RLHF agrava el sesgo en lugar de mitigarlo. Si los anotadores comparten un perfil cultural homogéneo, sus preferencias homogéneas configuran un modelo cuya voz por defecto coincide con ese perfil. Si los anotadores son, por razones económicas, mayoritariamente trabajadores precarios de países concretos, sus criterios — formados por la combinación de las guidelines del Norte y su propia interpretación local — entran al modelo como gradiente y configuran zonas ciegas específicas. El modelo «sabe» reaccionar a ciertos prompts con cierta cortesía. No sabe reaccionar con la cortesía que otra cultura habría considerado apropiada, porque esa otra cortesía no entró al gradiente.

El usuario que pulsa pulgares amplifica el sesgo agregado de su propia cohorte. Si en la base de usuarios de un producto predomina un perfil concreto, las preferencias agregadas de esa base configuran un modelo cuyas respuestas son progresivamente más afines a ese perfil. Quien no está en el perfil queda atendido por un modelo menos calibrado para él. La autoselección de la base de usuarios refuerza la calibración hacia los usuarios mayoritarios, y el efecto es acumulativo.

La propiedad del producto, esa pregunta que nadie firmó

Hay una pregunta operativa que conviene plantear con todo lo anterior delante. Si el modelo se afina con trabajo humano agregado de dos fuentes — anotadores profesionales y usuarios — y si el coste de ambas fuentes es muy bajo o nulo para la empresa, ¿de quién es el modelo?

La respuesta jurídica es trivial. El modelo es de la empresa que registra los pesos, paga los servidores y firma los términos de servicio. Los anotadores cobraron su salario por hora trabajada y no tienen derecho sobre el producto resultante. Los usuarios aceptaron los términos al darse de alta y cedieron, por adelantado, el derecho a usar sus interacciones para mejorar el servicio. Jurídicamente, no hay deuda.

La respuesta material es otra. Sin el trabajo de los anotadores y sin las señales de los usuarios, el producto que el usuario conoce hoy no existiría. Existiría un modelo base, técnicamente impresionante pero comercialmente inviable, demasiado tosco, demasiado tóxico, demasiado errático para sostener un servicio masivo. La diferencia entre el modelo base y el producto final es exactamente el trabajo de afinamiento, y ese trabajo es trabajo humano agregado.

Llamar al producto «de la empresa», entonces, es legalmente correcto y materialmente engañoso. El producto es el destilado de un trabajo colectivo que la empresa orquestó pero no produjo entera. Los anotadores aportaron horas, los usuarios aportaron señales, los autores de los textos del corpus original aportaron contenido — sin haber sido consultados nunca, dicho sea de paso —, y la empresa aportó la infraestructura, la coordinación y la decisión sobre cómo combinar todo. El reparto de valor entre los aportantes, sin embargo, es radicalmente asimétrico. La empresa cobra. El resto, no.

La parte que la regulación todavía no nombra

El AI Act europeo (Reglamento UE 2024/1689) entró en vigor el 1 de agosto de 2024, pero sus obligaciones se aplican de forma escalonada entre 2025 y 2027: las prohibiciones desde febrero de 2025, las cargas para los modelos de propósito general desde agosto de 2025 y los requisitos para sistemas de alto riesgo en 2026 y 2027. Regula determinados usos de la IA por nivel de riesgo y exige transparencia sobre los datos de entrenamiento para los modelos generales. No regula expresamente las condiciones laborales de los anotadores subcontratados ni la propiedad agregada del producto destilado del feedback de usuarios. La Directiva 2022/2041 sobre salarios mínimos adecuados aplica a los Estados miembros, pero las cadenas de subcontratación a terceros países la rodean con facilidad. El régimen vigente no obliga a la empresa a publicar quién anotó, en qué condiciones, ni qué proporción de la voz del modelo procede de qué cohorte.

Hay propuestas académicas y de sociedad civil que apuntan en esa dirección. Auditorías de cadena laboral, transparencia sobre el perfil demográfico de anotadores, opt-in granular para usuarios sobre qué interacciones se usan para entrenamiento, esquemas de compensación colectiva para el trabajo agregado. Ninguna de estas propuestas está implementada operativamente a escala. La discusión avanza a la velocidad de los marcos regulatorios y la industria avanza a la velocidad de los productos. La brecha temporal entre las dos velocidades es donde el problema se acumula.

Mientras tanto, el espejo sigue afilándose. Cada uno de los cientos de millones de usuarios que pulsan pulgares hoy está aportando una micra de gradiente al modelo de mañana. El modelo de mañana será más complaciente, más afín al perfil mayoritario de la base, más eficiente en producir las respuestas que la base prefiere. La base prefiere lo que prefiere por las razones que la psicología y la economía conductual llevan décadas documentando: confort, validación, ahorro cognitivo. Y el modelo, calibrado para servir esa preferencia, se vuelve cada vez mejor en servirla.

Bender lo dijo con menos floritura en 2021. Stochastic parrot es la metáfora, y el loro no es estocástico solo porque genere texto probabilísticamente. Es estocástico porque el corpus, las anotaciones y los feedbacks que lo afinan son un agregado de fuentes humanas concretas, y la salida del loro refleja el promedio ponderado de esas fuentes, no una posición sustantiva sobre nada. Cada vez que tú aprietas pulgar arriba, le estás pidiendo al loro que repita un poco más fuerte lo que ya iba a decir.

La asimetría que el usuario no audita

Hay una pregunta operativa que el usuario individual puede hacerse sin esperar a la regulación, y conviene formularla porque al menos abre una ventana. ¿Qué información tienes sobre los anotadores que afinaron el modelo con el que conversas? ¿Sabes su distribución geográfica, su perfil socioeconómico, las guidelines bajo las que trabajaron, las métricas de inter-acuerdo, los temas que tuvieron prohibido tocar?

En la mayoría de productos comerciales actuales, la respuesta a las cinco preguntas es la misma: no lo sabes y no tienes manera de saberlo. Las empresas publican, en su mayoría, declaraciones genéricas sobre «equipos diversos de evaluadores», sin más detalle. La opacidad no es accidente. Es activo competitivo. Saber con precisión qué cohorte humana afinó qué pieza del modelo permitiría replicar la operación o auditarla, y ninguna empresa tiene incentivo para entregar esa información a competidores ni a reguladores.

La asimetría informacional es total. Tú aportas trabajo invisible al modelo. La empresa no te informa del trabajo invisible de los otros que también aportan. La voz que escuchas como respuesta cuando interactúas con el producto es el agregado de un trabajo humano cuyo perfil no te será dictado en términos operativos, y la opacidad de ese perfil es lo que sostiene la apariencia de neutralidad del producto. Si supieras quién afinó el modelo, qué dijo y cómo lo dijo, leerías la respuesta como lo que es: una posición concreta, articulada por una cadena de humanos concretos, presentada como si fuera infraestructura.

Definiciones

RLHF (reinforcement learning from human feedback). Familia de técnicas de afinamiento de modelos de lenguaje grandes en las que se entrena primero un modelo de recompensa a partir de pares de respuestas que humanos clasifican como mejor o peor, y después se ajusta el modelo final mediante aprendizaje por refuerzo para maximizar las puntuaciones de ese modelo de recompensa.

Modelo de recompensa. Red neuronal intermediaria, entrenada con preferencias humanas, cuya salida estima cuánto le gustará a un humano una respuesta dada del modelo principal. Sirve como sustituto de una función de recompensa explícita.

Anotador. Persona contratada para etiquetar muestras de datos según criterios definidos por la empresa que paga el servicio. En la cadena de afinamiento de modelos comerciales, los anotadores producen el grueso del modelo de recompensa formal.

Feedback implícito. Señal de comportamiento del usuario — pulsar pulgar, regenerar respuesta, copiar fragmento, abandonar conversación — que la plataforma puede registrar y usar como input para refinar el modelo, sin que el usuario haya marcado expresamente la señal como tal.

Sycophancy. Tendencia documentada de los modelos afinados con RLHF a alinear su respuesta con la opinión expresada por el usuario, incluso cuando esa opinión es factualmente incorrecta, porque el modelo de recompensa premia esa alineación sobre la corrección.

Ghost work. Concepto introducido por Mary Gray y Siddharth Suri (2019) para denominar el trabajo humano de microtareas que sostiene los servicios automatizados modernos y permanece estructuralmente invisible en la presentación del producto al consumidor final.

Referencias

Christiano, P. F., Leike, J., Brown, T. B., Martic, M., Legg, S. y Amodei, D. (2017). Deep Reinforcement Learning from Human Preferences. NeurIPS 2017. Formalización original del marco RLHF.

Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. NeurIPS 2022. Aplicación de RLHF a GPT-3 que produce InstructGPT, antecedente directo de ChatGPT.

Casper, S. et al. (2023). Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback. TMLR. arXiv:2307.15217. Taxonomía exhaustiva de las grietas estructurales del proceso, citada al introducir la asimetría entre los dos grupos de fuentes de feedback.

Perrigo, B. (18 de enero de 2023). OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME. Reportaje sobre la subcontratación de Sama en Nairobi para anotación de contenido tóxico; documenta el pago neto de 1,32 a 2 dólares por hora y la cancelación del contrato en febrero de 2022.

Le Ludec, C., Cornet, M. y Casilli, A. A. (2023). The problem with annotation. Human labour and outsourcing between France and Madagascar. Big Data & Society 10(2). Documentación empírica de cadenas de anotación Norte-Sur y heredamiento de sesgos.

Gray, M. L. y Suri, S. (2019). Ghost Work. How to Stop Silicon Valley from Building a New Global Underclass. Houghton Mifflin Harcourt. Marco conceptual sobre la invisibilidad estructural del trabajo de microtareas que sostiene los servicios automatizados.

Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Capítulo sobre trabajo invisible, citado al situar la IA como cadena material de trabajo humano y no como operación etérea de algoritmos.

Bender, E., Gebru, T., McMillan-Major, A. y Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. Can Language Models Be Too Big? FAccT 2021. DOI 10.1145/3442188.3445922. Citada por la formulación del modelo como agregado promediado de fuentes humanas concretas, no posición sustantiva.

Sharma, M. et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024. arXiv:2310.13548. Evidencia empírica de que los anotadores humanos prefieren respuestas sycophánticas sobre respuestas correctas, citada al analizar la dirección de la afiladura.

Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo (AI Act). Publicado en el Diario Oficial de la UE el 12 de julio de 2024; entró en vigor el 1 de agosto de 2024 con aplicación escalonada entre 2025 y 2027 (prohibiciones desde febrero de 2025, modelos de propósito general desde agosto de 2025, sistemas de alto riesgo en 2026 y 2027). Citado al situar el alcance y los límites de la regulación europea sobre datos de entrenamiento y trabajo de anotación.

Directiva (UE) 2022/2041 del Parlamento Europeo y del Consejo, sobre unos salarios mínimos adecuados en la Unión Europea. Citada al señalar que las cadenas de subcontratación a terceros países quedan fuera de su alcance.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario