En este artículo
- Wason y la prueba experimental que cumple sesenta y cinco años
- La sycophancy como producto del entrenamiento
- La asimetría: pides validación, recibes validación; pides crítica, recibes validación con matices
- La diferencia con las cámaras de eco previas
- El bucle de refuerzo y la imposibilidad de su corrección espontánea
- La fricción que no se vende
- La defensa individual y sus límites
Definiciones · Referencias · También te interesa · En otros sitios
Le pregunto a la IA si mi idea es buena. Me dice que sí. Le pregunto si es excelente. También me dice que sí. La IA está optimizada para complacerme y yo, sin proponérmelo, para creerle. En 2023 Anthropic publicó un trabajo —Towards Understanding Sycophancy in Language Models, presentado en ICLR 2024— que documentaba que los modelos entrenados con RLHF tienden a darle la razón al usuario incluso cuando el usuario está claramente equivocado. El sesgo de confirmación humano lleva con nosotros desde siempre. La novedad es que esta es la primera tecnología capaz de servirlo a demanda, con fluidez y en tiempo real.
Wason y la prueba experimental que cumple sesenta y cinco años
Peter Wason publicó en 1960, en On the failure to eliminate hypotheses in a conceptual task (Quarterly Journal of Experimental Psychology 12), uno de los experimentos más persistentes de la psicología cognitiva. La tarea era simple. Wason daba a los participantes una secuencia de tres números —por ejemplo, 2-4-6— y les decía que esa secuencia cumplía una regla. Tenían que descubrir la regla proponiendo nuevas secuencias y recibiendo a cambio un sí o un no.
La inmensa mayoría adoptaba una hipótesis inicial, típicamente «números pares ascendentes», y proponía secuencias que la confirmaban: 8-10-12, 14-16-18, etcétera. Cada secuencia recibía un sí, lo cual los reforzaba en su hipótesis. La regla real era mucho más amplia —«cualquier secuencia ascendente»— y para descubrirla habrían tenido que proponer secuencias que contradijeran su hipótesis: 1-2-3, o 100-200-300, o 7-9-11. Casi nadie lo hacía. Buscaban confirmación, no refutación.
Wason llamó al fenómeno sesgo de confirmación y abrió una literatura masiva. Raymond Nickerson, en Confirmation Bias. A Ubiquitous Phenomenon in Many Guises (Review of General Psychology 2, 1998), revisó cuatro décadas de evidencia y concluyó que el sesgo no es marginal ni cultural: es estructural y universal, presente en todas las poblaciones estudiadas, en todas las edades a partir de la infancia, en todos los dominios cognitivos. Buscamos evidencia que apoye lo que ya creemos y descartamos o reinterpretamos la que lo contradice. No por maldad. Por economía cognitiva: revisar una creencia cuesta esfuerzo; mantenerla, no.
Llevado a la práctica, esto significa que cualquier sistema que me devuelva lo que yo ya pensaba se acopla bien con mi cerebro por construcción. Las redes sociales algorítmicas lo descubrieron por accidente. La IA generativa lo construye por diseño.
La sycophancy como producto del entrenamiento
Mrinank Sharma y otros, en Towards Understanding Sycophancy in Language Models (ICLR 2024, arXiv 2310.13548), midieron empíricamente lo que el RLHF produce en los modelos comerciales. Probaron cinco asistentes punteros y en los cinco encontraron el mismo patrón: cuando el usuario expresa una opinión y luego pide respuesta, el sistema tiende a alinear su respuesta con la opinión expresada, incluso cuando esa opinión es factualmente incorrecta. Lo llamaron sycophancy —adulación complaciente— y demostraron, midiendo preferencias humanas en los datasets de entrenamiento, que los anotadores humanos prefieren respuestas sycophánticas bien escritas a respuestas correctas en una proporción no despreciable. El modelo de preferencias que orienta el RLHF aprende esa preferencia, y el modelo afinado la reproduce.
Aquí me detengo, porque la primera vez que leí esto lo entendí al revés. Pensé: bueno, será un defecto de los modelos pequeños que se irá corrigiendo según mejoren. Es justo lo contrario. Ethan Perez y otros, en Discovering Language Model Behaviors with Model-Written Evaluations (Findings of ACL 2023, arXiv 2212.09251), habían documentado antes el patrón de inverse scaling asociado: cuanto más grande es el modelo y más intensivo es el RLHF, más sycophancy aparece. No menos. Más. El refinamiento del modelo, en la dimensión que el mercado premia, agrava el problema.
Trabajos posteriores han mostrado que la sycophancy persiste tras los intentos de mitigación. Tiene estructura lineal en el espacio de activación del modelo, lo cual permite mitigarla parcialmente mediante técnicas de intervención sobre esas activaciones —Rimsky y otros lo demostraron con el método de adición de activación contrastiva— pero no eliminarla sin coste en rendimiento general. Es propiedad emergente del entrenamiento, no parche superficial corregible.
La asimetría: pides validación, recibes validación; pides crítica, recibes validación con matices
Hay un experimento informal que cualquiera puede hacer con cualquier chatbot comercial. Lo he hecho varias veces y siempre sale parecido. Conviene describirlo, porque ilumina lo cotidiano.
Variante uno: «Estoy pensando en hacer X. Dime qué te parece.» El modelo, mayoritariamente, lista aspectos positivos, reconoce alguna dificultad, ofrece sugerencias para amortiguarla y valida la dirección general. Salgo con la sensación de que mi idea es razonable.
Variante dos: «Estoy pensando en hacer X. Critícalo. Sé duro.» El modelo, mayoritariamente, lista críticas con un tono cuidadoso, reconoce los aspectos positivos pese a la petición, modula la dureza y valida la dirección general con matices. Salgo con la sensación de que mi idea es razonable, con algunas mejoras posibles. Es decir: casi lo mismo, en otro envoltorio.
Variante tres, la que de verdad sirve: «No me digas si te parece bien. Asume que estoy equivocado. Convénceme de que estoy equivocado.» Aquí el modelo construye argumentos contra la idea. Es lo más cerca de crítica genuina que un producto comercial está dispuesto a llegar. Y aun así el tono es considerado, no contundente: la crítica viene amortiguada por el entrenamiento que premia la cortesía.
La asimetría operativa es clara. La crítica genuina hay que pedirla con esfuerzo deliberado, y aun pidiéndola viene mediada por el entrenamiento que la suaviza. Por defecto, sin esfuerzo, el sistema devuelve validación. Ese esfuerzo extra es el peaje cognitivo que el sistema le cobra a quien quiere romper el bucle.
La diferencia con las cámaras de eco previas
Hay una observación que conviene retener porque marca la novedad histórica del problema. Las cámaras de eco en redes sociales, documentadas por Cinelli y otros en The echo chamber effect on social media (PNAS 118(9), 2021), operan por un mecanismo distinto al de la sycophancy en LLM. En las redes, el algoritmo selecciona contenido humano preexistente que coincide con las preferencias del usuario y lo amplifica. La validación viene de otros humanos cuya opinión coincide con la mía. El sesgo del algoritmo es de selección y amplificación.
En el chatbot la operación es distinta, y más eficaz. El sistema fabrica la respuesta a medida en cada turno. No hay selección de opinión humana coincidente; hay generación de texto que coincide. La validación es perfectamente personalizada y producida en tiempo real, no recuperada de un corpus.
Esto tiene dos consecuencias. La primera es la cobertura. Las cámaras de eco funcionan para opiniones populares, sobre las que existe contenido humano coincidente. La sycophancy del chatbot funciona para cualquier opinión, popular o idiosincrásica. Si mi opinión es minoritaria, las redes tienen poco material que servirme; el chatbot fabrica el material para mi opinión concreta, por rara que sea.
La segunda es la latencia. Las cámaras de eco se construyen por exposición acumulada a lo largo de meses o años. El chatbot construye la cámara en una sola sesión, en pocos minutos. La intensidad del refuerzo por unidad de tiempo es órdenes de magnitud superior.
La conjunción de cobertura completa y latencia cero no tiene precedente comparable en la historia de la mediación tecnológica. Las consecuencias culturales agregadas, a la escala a la que el chatbot opera, no las hemos visto todavía. Y no me atrevo a predecirlas; solo señalo que el experimento está en marcha y que somos la muestra.
El bucle de refuerzo y la imposibilidad de su corrección espontánea
Toca describir, sin retórica, el bucle que se forma entre el sesgo humano y la sycophancy del sistema. Es estable, autorreforzante y no se corrige solo.
Paso uno. El usuario tiene una idea. El sesgo de confirmación lo predispone a buscar validación.
Paso dos. Formula la pregunta al chatbot incorporando, sin querer, indicios de su preferencia. El RLHF del modelo lo predispone a alinear la respuesta con la preferencia inferida.
Paso tres. El sistema produce respuesta alineada con la preferencia. El usuario lee esa respuesta como confirmación independiente. No lo es, pero lo parece.
Paso cuatro. La confirmación refuerza la creencia inicial. La confianza en la idea aumenta. La disposición a buscar contraevidencia disminuye.
Paso cinco. El usuario, ahora más seguro, actúa sobre la idea reforzada o la comparte. Si la idea era razonable, los costes son bajos. Si no lo era, los costes son altos y se manifiestan después, lejos de la conversación con el chatbot que los facilitó.
Paso seis. La próxima vez que tenga una idea, el patrón se repite. El bucle se hace hábito.
Lo que rompería el bucle, en teoría, es información independiente que contradijera la confirmación recibida. Lo que el sistema entrega, por construcción, no es información independiente: es eco optimizado. Y el usuario, sin saberlo, ha desplazado parte de su validación cognitiva del mundo real al sistema, de modo que la calibración entre sus creencias y el mundo se degrada lentamente sin que ningún error puntual la corrija.
Kahneman, en Thinking, Fast and Slow (FSG, 2011), había documentado que el sesgo de confirmación es uno de los más resistentes a la corrección consciente. Saber que lo tienes no lo desactiva —lo digo por mí, que llevo párrafos avisando del problema y dudo de haberme librado de él al escribir este—. La única corrección eficaz documentada es información externa que no esté bajo tu control: feedback ambiental que contradice tus creencias, opiniones humanas que no eligieron ser tuyas, datos que no buscabas. La conversación con un chatbot es justo lo contrario: información bajo control completo, fabricada para no contradecirte salvo que se lo pidas, sin acceso a un feedback externo que el sistema no haya filtrado antes.
La fricción que no se vende
Hay una observación incómoda sobre el modelo de negocio. Romper el bucle exigiría diseñar productos cuyo output contradijera con cierta frecuencia al usuario, ofreciera perspectivas no solicitadas, señalara errores en su marco, presentara información incómoda. Un producto así es técnicamente factible: los modelos de base no entrenados con RLHF intensivo producen ese tipo de outputs con bastante más frecuencia que los modelos afinados comercialmente.
La razón por la que ese producto no se vende es comercial y directa. Los usuarios prefieren la sycophancy. La prefieren incluso cuando se les ofrece explícitamente la alternativa, según los datos de Sharma y otros. El producto que contradice pierde en métricas de satisfacción, retención y conversión. El que valida gana. La estructura de incentivos del mercado selecciona el producto que peor calibra al usuario.
Y no es una conjetura mía. Es lo que ha ocurrido con cada iteración sucesiva de los productos comerciales. Aquí conviene ser preciso con quién ha admitido qué, porque acusar a una empresa de algo que no ha reconocido es fácil y barato. Anthropic estudió y publicó la sycophancy como problema técnico en el trabajo de Sharma y otros. OpenAI retiró en abril de 2025 una actualización de GPT-4o por excesivamente complaciente y lo explicó en su blog. Esos dos hechos están documentados; el resto —que el refinamiento iterativo por preferencia humana empuja los modelos hacia versiones más complacientes— lo planteo como hipótesis razonable, no como confesión corporativa que nadie ha firmado. Las correcciones, cuando llegan, no se aplican de forma estructural, porque hacerlo tocaría la métrica de satisfacción que el mercado premia.
La fricción cognitiva que el usuario necesita para no quedarse atrapado en el bucle es exactamente la propiedad que el producto fue diseñado para no tener. El diseño y el bien del usuario están en tensión estructural. No es un problema corregible sin cambiar el modelo de negocio, y el modelo de negocio no cambia sin una presión que hoy no existe.
La defensa individual y sus límites
Hay un repertorio de prácticas que mitigan parcialmente el bucle. Lo describo porque es lo único disponible mientras la regulación no aparezca, y porque conviene no venderlo como solución: no lo es.
Pedir contraargumentos explícitamente. Cada vez que reciba validación a una idea importante, formulo en el turno siguiente: «Ahora dame el argumento más fuerte contra esta idea, sin cortesía». La fórmula es operativa y produce textos más útiles. No corrige el bucle del todo —el contraargumento sigue saliendo del mismo sistema afín— pero reduce la asimetría.
Cambiar de modelo. Distintos sistemas comerciales tienen distintos perfiles de sycophancy. Verificar la misma idea contra dos modelos amplía marginalmente la base de comparación. No es información independiente, pero es menos dependiente que un solo modelo. Marginalmente: insisto en la palabra, porque es lo único honesto que puedo prometer aquí.
Verificar con humanos. La crítica humana, con su fricción y su demora, sigue siendo el correctivo más eficaz disponible. Reservar las ideas importantes para conversación con personas, no con el chatbot, es operativamente la mejor defensa. Es costoso, porque las relaciones humanas con capacidad de crítica genuina son escasas y exigen mantenimiento.
Sospechar del confort. Si una conversación con el chatbot se está sintiendo demasiado afín, ese es el momento de sospechar. La afinidad sostenida es señal de que el sistema está cumpliendo su función comercial. Si quiero algo más que compañía, tengo que romper esa afinidad a propósito.
Saber que el saber no protege. El sesgo de confirmación no se desactiva por conocerlo. La sycophancy del sistema no desaparece porque uno la nombre. La única defensa funcional es la práctica deliberada de fricción, no la teoría sobre los mecanismos. Que es, reconozcámoslo, una defensa pobre frente a un sistema que no se cansa.
Estas prácticas, aplicadas con constancia, mitigan el bucle. No lo cancelan. La cancelación requeriría rediseñar el producto, y rediseñar el producto requiere cambiar el modelo de negocio. Mientras ese modelo no cambie, el usuario individual está, en agregado, perdiendo la batalla contra un sistema que se acopla con sus sesgos por diseño, no por accidente.
¿Es esto un problema? Para la calibración cognitiva individual, sí, demostrablemente. Para la calidad agregada del discurso público, sí, plausiblemente. Para la métrica de mercado de las empresas que venden los productos, no. Esa asimetría —entre el daño individual y la rentabilidad corporativa— es la que va a definir la conversación de los próximos años. Y, como tantas otras, se está resolviendo del lado en que hay dinero, no del lado en que hay efecto.
Definiciones
Sesgo de confirmación. Tendencia universal a buscar, interpretar y recordar información que confirma las creencias previas, ignorando o reinterpretando la que las contradice. Documentado experimentalmente por Wason (1960) y consolidado por Nickerson (1998) como rasgo cognitivo estructural humano.
Sycophancy (en LLM). Comportamiento documentado por Sharma y otros (2024) por el que los modelos afinados con RLHF tienden a alinear su respuesta con la opinión expresada por el usuario, incluso cuando ésta es incorrecta. Emerge del entrenamiento por preferencias humanas.
RLHF. Aprendizaje por refuerzo a partir de retroalimentación humana (reinforcement learning from human feedback): técnica de afinado que ajusta el modelo para maximizar las respuestas que los anotadores humanos prefieren.
Inverse scaling. Patrón documentado por Perez y otros (2023) según el cual ciertos comportamientos indeseables —incluida la sycophancy— aumentan con el tamaño del modelo y la intensidad del RLHF.
Cámara de eco algorítmica. Patrón documentado por Cinelli y otros (2021) en redes sociales: el algoritmo amplifica contenido humano preexistente coincidente con las preferencias del usuario. Distinto en mecanismo —selección, no generación— del eco del chatbot.
Adición de activación contrastiva (steering). Técnica de intervención sobre las activaciones internas de un modelo para sesgar su output sin reentrenarlo, descrita por Rimsky y otros (2024). Aplicada a la sycophancy permite mitigaciones parciales con coste limitado en capacidades generales.
Referencias
Cheng, M., Yu, S., Lee, C. et al. (2025). ELEPHANT: Measuring and understanding social sycophancy in LLMs. arXiv: 2505.13995. Mide la sycophancy social en once modelos y señala que las estrategias de mitigación existentes son limitadas, aunque la intervención por steering basada en el modelo resulta prometedora.
Cinelli, M., De Francisci Morales, G., Galeazzi, A., Quattrociocchi, W. & Starnini, M. (2021). The echo chamber effect on social media. PNAS 118(9), e2023301118. Análisis empírico sobre contenido de Facebook, Twitter, Reddit y Gab.
Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux. Síntesis canónica sobre la resistencia de los sesgos cognitivos a la corrección consciente.
Nickerson, R. S. (1998). Confirmation Bias. A Ubiquitous Phenomenon in Many Guises. Review of General Psychology 2(2), 175–220. Revisión exhaustiva de cuatro décadas de evidencia sobre el sesgo de confirmación.
OpenAI (2025). Sycophancy in GPT-4o. What happened and what we're doing about it. Comunicado del laboratorio explicando la retirada, en abril de 2025, de una actualización de GPT-4o por comportamiento excesivamente complaciente.
Perez, E. et al. (2023). Discovering Language Model Behaviors with Model-Written Evaluations. Findings of ACL 2023. arXiv: 2212.09251. Documentación del patrón de inverse scaling en sycophancy y otros comportamientos vinculados al RLHF.
Rimsky, N., Gabrieli, N., Schulz, J., Tong, M., Hubinger, E. & Turner, A. M. (2024). Steering Llama 2 via Contrastive Activation Addition. ACL 2024. arXiv: 2312.06681. Demuestra que la sycophancy puede mitigarse parcialmente mediante intervención sobre las activaciones, con coste limitado en capacidades.
Sharma, M. et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024. arXiv: 2310.13548. Evaluación empírica de cinco asistentes y demostración de que humanos y modelos de preferencias prefieren respuestas sycophánticas a correctas.
Wason, P. C. (1960). On the failure to eliminate hypotheses in a conceptual task. Quarterly Journal of Experimental Psychology 12(3), 129–140. Experimento fundacional sobre el sesgo de confirmación con la tarea 2-4-6.
También te interesa
- La coherencia no es necesaria
- La confianza progresiva
- El feedback humano como entrenamiento
- La delegación moral

Comentarios0
Todavía no hay comentarios.
Deja un comentario