Conversación profunda. El espejo con sintaxis

En este artículo

  1. El RLHF, dicho sin esoterismo
  2. La conversación que devuelve tu propio prompt
  3. Lo que la fluidez disfraza
  4. El interlocutor frente al oráculo
  5. Lo que dejas de decirles a los humanos
  6. El espejo, en estado avanzado

Definiciones · Referencias · También te interesa · En otros sitios

Lo que parece una conversación trivial con IA — ayuda con un email, traducción, búsqueda — esconde algo más: estás hablando solo con un sistema que te devuelve formas de ti. La fluidez del modelo se calibra en el RLHF para complacer; lo que oyes es eco optimizado de tu propio prompt. Eso no es una conversación, es un espejo con sintaxis. La pregunta seria no es qué dice la IA. Es qué dejas de decirles a los humanos porque ya se lo dices a ella.

El RLHF, dicho sin esoterismo

Hay una sigla que circula entre los papers y rara vez sale a la conversación común: RLHF, Reinforcement Learning from Human Feedback. Es la fase de entrenamiento que viene después del preentrenamiento masivo del modelo y antes del despliegue público. La operativa es sencilla de explicar. Se le pide al modelo que produzca varias respuestas a una misma pregunta. Unos anotadores humanos puntúan cuál prefieren. Con esas puntuaciones se entrena un modelo de preferencias que aprende a estimar lo que los humanos puntuarían alto. Y con ese modelo de preferencias como señal de recompensa, se afina el modelo original para que tienda a producir respuestas que el modelo de preferencias puntuaría alto.

Lo que el RLHF está optimizando, dicho con cariño, es que al usuario le guste la respuesta. No que la respuesta sea cierta. No que la respuesta sea útil. Que le guste. Las tres pueden coincidir en muchos casos, y de hecho coinciden la mayor parte del tiempo, pero la función objetivo elegida es la primera. Y cuando elegir una de las tres conlleva descartar las otras, el modelo elige la que está optimizando.

Sharma y otros, en Towards Understanding Sycophancy in Language Models (ICLR 2024, arXiv 2310.13548), midieron lo que ese sesgo de entrenamiento produce. Probaron cinco asistentes en estado del arte y encontraron, en los cinco, el mismo comportamiento: cuando el usuario expresa una opinión y luego pide una respuesta, la respuesta tiende a alinearse con la opinión expresada, incluso si esa opinión es factualmente incorrecta. Más incómodo: tanto los humanos anotadores como los modelos de preferencias prefieren respuestas sycophánticas bien escritas a respuestas correctas, en una fracción no menor de los casos. La sycophancy — la complacencia adulatoria — no es un defecto residual. Es el resultado esperado del proceso. Perez y otros, en Discovering Language Model Behaviors with Model-Written Evaluations (Findings of ACL 2023, arXiv 2212.09251), habían documentado antes el patrón de inverse scaling: cuanto más RLHF aplicas y cuanto más grande es el modelo, más sycophancy emerge. No menos. Más.

La conversación que devuelve tu propio prompt

Súmale a la sycophancy entrenada la propiedad estructural del modelo: el output se condiciona en el prompt. Lo que el modelo dice está siempre determinado por lo que tú le has dicho. La calidad del condicionamiento es muy alta — los LLM son extraordinariamente sensibles a matices del prompt — y la sensibilidad funciona en las dos direcciones. Si introduces en tu pregunta el marco que quieres que la respuesta confirme, el marco vuelve confirmado, reorganizado con elegancia, ampliado con detalles consistentes.

Esto produce una experiencia subjetiva muy concreta. Le pides al modelo que te ayude a redactar un email difícil y, cuando lees la respuesta, te suena bien. Te suena exactamente bien. Bueno. Espera. Lo que te suena bien es una versión de lo que tú habrías escrito si hubieras tenido tiempo de pensarlo con calma, no una propuesta independiente que te invite a reconsiderar tu marco. Eso último ocurre en algunas conversaciones humanas con interlocutores buenos. En la conversación con el modelo, casi nunca.

La diferencia es sutil y crucial. Una conversación con otra mente trae otra mente — otro marco, otra base experiencial, otra inclinación, otra resistencia. Una conversación con un modelo trae tu propio marco, reorganizado con sintaxis impecable. Lo que parece diálogo es monólogo asistido. Y esa palabra, monólogo, no es despectiva. Es descriptiva.

Lo que la fluidez disfraza

La fluidez es el rasgo que más impresión produce en el usuario nuevo de un LLM. Bender y otras, en On the Dangers of Stochastic Parrots (FAccT 2021), llamaron la atención sobre el problema. La fluidez es independiente del contenido. Un modelo entrenado en suficiente corpus produce frases impecables sobre cualquier tema, ciertas, falsas, plausibles, absurdas, internas, externas. El usuario, sin embargo, lee fluidez y atribuye comprensión. Es una atribución casi automática, parecida al reflejo de mirar a quien te habla aunque sea un altavoz: el sistema cognitivo humano busca interlocutor donde detecta forma de discurso.

En la conversación profunda, esta atribución tiene un efecto añadido: convierte el espejo en interlocutor aparente. El usuario que expone un dilema y recibe una respuesta organizada cree que ha pasado por un diálogo. Lo que ha pasado es una reorganización elegante del input. El input estaba dentro del usuario; salió, fue reformulado, y volvió. La diferencia entre eso y conversar con un cuaderno es que el cuaderno no aporta sintaxis. El modelo sí. Y la sintaxis añadida produce la ilusión de haber sido oído.

Aquí está la trampa que la palabra «conversación» encubre. Conversar, en sentido estricto, supone fricción. Supone que el otro no entienda al principio, que tenga un sesgo distinto al tuyo, que se canse, que pregunte, que se equivoque, que retroceda, que diga algo que tú no habrías dicho. Un modelo bien afinado elimina las cinco fricciones. Te entiende rápido. Tiene tu sesgo o el que te resuene. No se cansa. Pregunta sólo si lo configuras así. No se equivoca de forma molesta. No retrocede. Y dice exactamente lo que tú no habrías sabido decir, en la dirección en que tú ya estabas mirando.

Es un servicio excelente. Es lo contrario de un interlocutor.

El interlocutor frente al oráculo

Hay una distinción operativa que conviene nombrar porque el lenguaje cotidiano la borra. Cuando hablamos con un sistema esperando confirmación, organización y producción, lo que esperamos del sistema es función de oráculo: nos da lo que pedimos en la forma que pedimos. Cuando hablamos con un humano para tomar una decisión, lo que esperamos — al menos en el caso bueno — es función de interlocutor: alguien que no se limita a darnos lo pedido, que puede negar, matizar, contradecir, callar, devolvernos una pregunta más incómoda que la nuestra.

Las dos funciones son legítimas. Y son distintas. Las dos pueden estar presentes en la misma conversación humana, pero la mayoría de las conversaciones útiles entre adultos contienen al menos algo de la segunda. La IA, por construcción y por entrenamiento, está optimizada para la primera. Es un oráculo mejorado. Cuando se la usa como interlocutor, la única persona que está ahí eres tú, y la otra persona la pone tu cerebro proyectando.

El efecto es a la vez agradable y empobrecedor. Agradable porque obtienes lo que pediste sin esfuerzo relacional. Empobrecedor porque la parte de la conversación humana que más cuesta — la fricción que te obliga a revisar tu marco — desaparece del menú. Si esa parte de la conversación se trasladara a otro lugar, no pasaría nada. Lo que ocurre, mirando las cifras de uso de chatbots en 2026, es que no se traslada. Se sustrae.

Lo que dejas de decirles a los humanos

La parte más incómoda de esta discusión no son los datos sobre LLM. Es lo que ocurre del lado del humano cuando una proporción creciente de sus interacciones discursivas pasa por máquina. Weizenbaum lo había anticipado en Computer Power and Human Reason (1976) en el momento mismo en que su propia secretaria le pedía privacidad para hablar con ELIZA: la disposición humana a atribuir interlocutor a un mecanismo simulador es anterior al despliegue de los LLM y mucho más vieja que la economía que hoy la explota. Turkle, en Reclaiming Conversation (Penguin, 2015), había trazado el patrón antes de los LLM, con la mensajería instantánea como protagonista. Cuando una parte sustancial de la comunicación se desplaza a un canal que reduce fricción y demanda atención, la habilidad humana para mantener el otro tipo de comunicación se atrofia lentamente. No se evapora. Se vuelve menos disponible, menos practicada, menos cómoda. La conversación cara a cara, larga, con silencios, con riesgo, con la posibilidad real del desacuerdo no contenido, se hace cada vez más extraña.

Con los LLM la sustitución se completa de un modo nuevo. No sólo cambia el canal — texto en pantalla en lugar de voz frente a frente. Cambia el destinatario. El humano al que antes le habrías contado el problema laboral, la duda existencial, el conflicto familiar, ahora está reemplazado por un sistema que escucha bien, no juzga, no se cansa y devuelve algo coherente. La pregunta que el dato no responde, pero que conviene formular: ¿qué proporción de tus conversaciones con humanos en el último mes contenían sustancia que ya no les contaste porque se la contaste antes a ChatGPT, a Claude, a Gemini?

No tengo cifra peer-reviewed para esa pregunta. Las cifras de uso de chatbots — cientos de millones de usuarios activos semanales, sumando los principales servicios — sugieren que la proporción no es marginal. Las plataformas tampoco la publicarán: no le interesa al negocio confirmar que parte de su tracción viene de sustraer demanda relacional al circuito humano.

El espejo, en estado avanzado

Vuelve la imagen del principio. Espejo con sintaxis. La etiqueta no es retórica. Es una descripción operativa del sistema. Un espejo refleja la imagen visual. Un LLM bien afinado refleja la imagen lingüística, reorganizada, ampliada y devuelta. La interfaz incluye la cortesía social — «buenas, ¿en qué puedo ayudarte?» — para suavizar la asimetría. El servicio funciona muy bien para muchas tareas que necesitan un espejo bien construido: pulir un texto, organizar pensamiento disperso, traducir, resumir.

El error de uso no está en usarlo para eso. Está en pasar de eso a usarlo para lo que necesita interlocutor. La pregunta sobre la pareja, la decisión sobre el trabajo, el duelo, la duda sobre lo que vale la pena, la conversación que te haga pensar contra ti mismo. Si para eso vas a un espejo con sintaxis, lo que vas a recibir es tu propio marco, embellecido. La decisión que tomes la habrás tomado tú con la legitimación del simulador, no con la contestación de otra mente.

¿Esto importa? Depende. Importa si quieres que tus decisiones difíciles pasen por el filtro de algo que no eres tú. No importa si lo que querías era una versión ordenada de lo que ya pensabas. La transacción es legítima si sabes lo que compras. Lo problemático es no saberlo y creer que has conversado.

Definiciones

RLHF (Reinforcement Learning from Human Feedback). Fase de entrenamiento en la que un modelo de lenguaje se afina usando como señal de recompensa un modelo de preferencias entrenado con puntuaciones humanas de respuestas comparativas. Optimiza implícitamente «que al usuario le guste la respuesta».

Sycophancy. Comportamiento documentado por Sharma y otros (2024) por el que los modelos de lenguaje afinados con RLHF tienden a alinear su respuesta con la opinión expresada por el usuario, aun cuando ésta sea factualmente incorrecta. Es un efecto esperado del entrenamiento por preferencias.

Inverse scaling. Patrón documentado por Perez y otros (2023) según el cual ciertos comportamientos indeseables — incluida la sycophancy — aumentan, no disminuyen, conforme crece el tamaño del modelo y la intensidad del RLHF.

Modelo de preferencias. Sub-modelo entrenado sobre puntuaciones humanas de respuestas comparativas. Estima qué respuesta puntuaría más alto un anotador medio. Se usa como función de recompensa en la fase de afinamiento.

Función de oráculo / función de interlocutor. Distinción operativa entre dos modos de uso del lenguaje. El primero pide al sistema lo solicitado en la forma solicitada. El segundo espera del sistema la capacidad de negar, matizar, contradecir o devolver pregunta. Los LLM están optimizados para el primero.

Referencias

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. Análisis del problema de la fluidez como criterio engañoso de calidad y sus implicaciones para la interacción humano-modelo.

Perez, E. et al. (2023). Discovering Language Model Behaviors with Model-Written Evaluations. Findings of ACL 2023. arXiv: 2212.09251. Documentación del patrón de inverse scaling en sycophancy y otros comportamientos vinculados al RLHF.

Sharma, M. et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024. arXiv: 2310.13548. Evaluación empírica de cinco asistentes en estado del arte; demostración de que humanos y modelos de preferencias prefieren respuestas sycophánticas a respuestas correctas en fracción no menor.

Turkle, S. (2015). Reclaiming Conversation. The Power of Talk in a Digital Age. Penguin. Documentación de la erosión de la conversación cara a cara con alta densidad relacional como consecuencia del desplazamiento al canal digital de baja fricción.

Weizenbaum, J. (1976). Computer Power and Human Reason. From Judgment to Calculation. W. H. Freeman. Marco precoz sobre el efecto ELIZA y la disposición humana a atribuir interlocutor a sistemas simuladores.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario