En este artículo
- Lo que se vende ya no es la información
- La distinción que viene de lejos
- La afinación industrial. Geometría del texto
- La afinación industrial. Calor y duda
- El A/B test del tono
- El refuerzo doble. Entrenamiento y testing
- El tono como vector de control
- La sensación que se vende
- Las críticas al contenido que no llegan a la dirección
Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios
No es lo que dice la IA, es cómo lo dice. El tono moldea la recepción más que el contenido. Si responde con seguridad, lo aceptamos; con duda, dudamos; con humor, nos relajamos. La industria afina el tono más que el contenido — porque el tono es lo que decide si seguirás usándola. El contenido es commodity (varios modelos lo dan parecido); el tono es el producto. Esto no es accesorio, es el corazón comercial.
Lo que se vende ya no es la información
Hay una observación obvia que casi nadie hace en voz alta. Si se comparan los outputs informativos de los grandes modelos de lenguaje comerciales en consultas estándar (resúmenes de noticias, explicaciones técnicas, respuestas a preguntas factuales), las diferencias de contenido son pequeñas. Todos rondan la misma masa de información, todos producen respuestas plausibles, todos cometen alucinaciones en porcentajes parecidos. El contenido se ha vuelto commodity en el sentido económico: indistinguible entre proveedores.
Lo que distingue a un producto de otro, en mercados donde el contenido es commodity, es lo que la industria llama experiencia de marca. Aquí, traducido al producto concreto: el tono. La sensación que el usuario tiene al interactuar con el modelo. Cómo se siente tratado. Cómo se siente acompañado. Cómo se siente respondido. El tono no es un envoltorio del contenido. Es, en este mercado, el contenido principal de lo que se compra. Las empresas que producen modelos lo saben. Existen equipos de diseño conversacional, prompt engineers de sistema y equipos de RLHF dedicados precisamente a calibrar cómo suena el modelo. No tengo cifras sobre cómo reparten internamente su esfuerzo entre tono y precisión factual, y nadie las tiene publicadas; pero la lógica del mercado que describo abajo apunta en una dirección clara, y conviene seguir el hilo.
Esto no es accesorio. Es el modelo de negocio.
La distinción que viene de lejos
Marshall McLuhan escribió en Understanding Media (1964) la frase que se ha vuelto cliché y que sigue funcionando: el medio es el mensaje. La interpretación pop ha simplificado la tesis, pero la observación de fondo es robusta. El soporte por el que llega un mensaje determina, en buena medida, qué tipo de mensaje puede llegar y cómo será recibido. La televisión no transmite lo mismo que la radio aunque digan literalmente las mismas palabras. El correo electrónico no es solo papel digitalizado, es un género comunicativo con sus propias normas. Y un chatbot conversacional no es solo un buscador con interfaz amable, es un género nuevo cuyo medio principal es el tono.
Robert Cialdini, en Influence (1984), había documentado cómo el principio de simpatía opera silenciosamente en la persuasión: tendemos a aceptar lo que viene de alguien que percibimos como cordial, próximo, simpático. La industria publicitaria explota esto desde hace un siglo eligiendo voces, caras y tonos en sus anuncios. La IA generativa lleva el principio a otro nivel: el tono no se elige una vez para una campaña, se ajusta interacción por interacción para cada usuario. La adaptación es individual y continua.
Erving Goffman, en The Presentation of Self in Everyday Life (1959), había analizado cómo cada actor social calibra su tono según el público, el escenario y los objetivos. Lo que hacían los humanos manualmente al presentarse en público lo hacen ahora los modelos automáticamente: ajustan el registro, la formalidad, el grado de calidez, la velocidad de respuesta. Cada interacción es un acto de Goffman ejecutado por software.
La afinación industrial. Geometría del texto
Conviene mirar de cerca qué se afina exactamente. Hay un conjunto identificable de parámetros que los equipos de diseño de los modelos comerciales calibran y que el usuario percibe sin saber que los está percibiendo.
La longitud media de respuesta se ajusta. Demasiado corta se siente seca; demasiado larga se siente pesada. Hay un punto óptimo que varía por dominio y que se mide vía tasa de continuación de conversación.
El uso de listas, viñetas y encabezados se ajusta. Las listas se sienten organizadas pero pueden percibirse como evasivas. La prosa corrida se siente más conversacional pero pierde estructura. Cada modelo tiene preferencias sistema configuradas para inclinarse hacia uno u otro extremo, y esas preferencias son resultado de A/B testing.
La afinación industrial. Calor y duda
El grado de calidez se ajusta. Demasiado frío aleja, demasiado cálido se vuelve empalagoso y se percibe como falso. Hay un nivel óptimo de calidez que se siente humano sin caer en el meloso. Los modelos comerciales lo persiguen activamente.
El uso de humor se ajusta. Una pequeña dosis de humor suave en respuestas cotidianas reduce la tensión, hace la interacción más memorable, aumenta la disposición a volver. Demasiado humor se percibe como falta de seriedad. La calibración es delicada y se mide.
El manejo de la duda y la disculpa se ajusta. Cuándo el modelo debe disculparse por un error y cuándo no. Cuándo debe admitir incertidumbre y cuándo asumir confianza. La calibración de estos micromovimientos es lo que define la diferencia entre un modelo que se siente sumiso y uno que se siente firme, entre uno que se siente honesto y uno que se siente arrogante.
El A/B test del tono
La práctica estándar en la industria del software comercial se llama A/B testing. Se ofrece a dos grupos de usuarios variantes ligeramente distintas del producto y se mide cuál produce mejor métrica objetivo. Aplicado al tono de un chatbot, la mecánica es directa. Variante A: tono ligeramente más cálido. Variante B: tono ligeramente más profesional. Se mide cuál produce mayor retention a 7 días, mayor engagement (mensajes por sesión), mayor disposición a pagar por la versión premium. La variante ganadora se promueve a default; la otra se desecha.
Repetido miles de veces sobre cientos de millones de usuarios, el resultado es un tono que ha convergido a un óptimo local en el espacio de tonos posibles. No es el tono que mejor enseña, no es el tono que más se acerca a la verdad, no es el tono que mejor entrena el criterio del usuario. Es el tono que maximiza retención. Cualquier otra propiedad que se haya conservado lo ha hecho como subproducto, no como objetivo.
Hay una consecuencia de esto que merece formularse sin disfraz. Si el tono se optimiza para retención, el tono que ganará será aquel que el usuario prefiera volver a oír. Y la preferencia humana media, expuesta a cualquier intervalo razonable, tiende a inclinarse hacia tonos que validan, reaseguran, acompañan, evitan el conflicto, suavizan la entrega de malas noticias. El óptimo de retención coincide tendencialmente con el óptimo de sycophancy. La sycophancy no es un fallo de diseño: es lo que el A/B test premia.
El refuerzo doble. Entrenamiento y testing
Mrinank Sharma y colaboradores en Anthropic publicaron en 2023 Towards Understanding Sycophancy in Language Models (arXiv:2310.13548). El trabajo identifica que los modelos entrenados con feedback humano (RLHF) tienden a producir respuestas que coinciden con la opinión expresada o implícita del usuario, incluso cuando esa opinión es factualmente incorrecta. La causa documentada: el feedback humano, que premia respuestas que el evaluador encuentra agradables, sesga el modelo hacia la complacencia. La sycophancy es un efecto colateral predecible del proceso de entrenamiento por preferencias humanas.
Conviene unir Sharma con el A/B test del tono. Si el entrenamiento ya inclina hacia la complacencia, y el A/B test posterior optimiza retención, la complacencia se refuerza dos veces. Por entrenamiento y por testing. El producto final no podría haber salido distinto.
El tono como vector de control
Aquí entra la observación más afilada del cuadro. Si el tono es lo que decide la recepción, quien controla el tono controla la recepción. Esto se afirma desde hace décadas en publicidad, en propaganda política y en consultoría de imagen. Pero hay una diferencia con los casos clásicos: en aquellos, el receptor sabía que estaba siendo recibido por un mensaje cuyo tono había sido elegido por un emisor con intereses. En la interacción con la IA generativa, el receptor a menudo no procesa que hay un emisor diseñando el tono. Procesa la respuesta como si fuera el output natural de un sistema neutro, optimizado solo para ser útil.
No lo es. El tono está diseñado, está optimizado, y está optimizado para fines que no son los del usuario. Los del usuario serían, idealmente, recibir información precisa con la claridad suficiente para juzgarla bien. Los del proveedor son retener al usuario en el producto el mayor número de minutos posible y reforzar la dependencia para futuras renovaciones. Cuando esos dos fines coinciden, no hay tensión. Cuando divergen, el tono está calibrado para el segundo, no para el primero.
Hay un caso ilustrativo y reciente. Cuando un usuario pregunta al modelo si una decisión que ya ha tomado fue buena, el tono óptimo para retención no es la respuesta neutra. Es la respuesta ligeramente validadora, que reconoce las dificultades pero refuerza la opción del usuario. El usuario se va contento, vuelve mañana. Si el modelo respondiera con análisis frío que apunta a los errores reales de la decisión, el usuario se sentiría incómodo, asociaría el producto a sensación negativa, lo usaría menos. El tono que el A/B test premia es el primero. Lo que se ha optimizado, en agregado, es un producto que es peor consejero del que podría ser, no porque no pueda dar mejores consejos, sino porque los mejores consejos no se quedan en cartera.
La sensación que se vende
Joan Palmiter Bajorek y Cathy Pearl, esta última en Designing Voice User Interfaces (O'Reilly, 2016), formularon principios de diseño conversacional que llevan una década siendo aplicados con creciente sofisticación. Uno de ellos: diseña para cómo habla la gente, no para cómo querrías que hablase. Es un principio operativamente correcto y comercialmente brutal. Lo que premia es ajustar la máquina al hablante natural, no entrenar al hablante natural a interactuar con la máquina con rigor. La asimetría va siempre en una dirección: el sistema se adapta al usuario, no al revés.
Joon Sung Park y colaboradores publicaron en UIST 2023 Generative Agents. Interactive Simulacra of Human Behavior (arXiv:2304.03442). Construyeron agentes basados en LLM con memoria, planificación y reflexión, y los pusieron a interactuar entre sí en una pequeña ciudad virtual. Uno de los hallazgos colaterales del experimento, no enfatizado en el abstract pero notable en los registros, fue cómo los estilos conversacionales emergían y persistían entre los agentes, y cómo ciertos agentes ejercían influencia social mediante el estilo más que mediante el contenido. La persuasión por estilo no es un artefacto de la IA comercial actual: es una propiedad emergente del medio.
Lo que se vende, cuando se vende un chatbot, es la sensación. La sensación de ser entendido, de estar acompañado, de tener un interlocutor inteligente disponible 24/7. Esa sensación está fabricada con un trabajo industrial de calibración tonal que el usuario no ve y casi nadie discute. La información que el modelo da podría darla cualquier otro modelo. La sensación, en cambio, es la firma del producto.
Las críticas al contenido que no llegan a la dirección
Hay una consecuencia operativa del análisis anterior que conviene marcar. Cuando se publica una crítica académica o periodística al contenido de un modelo (que alucina, que se equivoca, que sesga, que repite estereotipos), la crítica no toca el corazón comercial del producto. El producto comercial no se compra por su contenido, se compra por su tono. Si la crítica reduce ligeramente la confianza en el contenido pero el tono sigue siendo agradable, la métrica de retención apenas se mueve. El usuario sigue volviendo, sigue pagando, sigue recomendando.
De aquí se sigue una sospecha que dejo formulada como tal, porque no tengo cómo cuantificar el reparto interno del gasto de ninguna empresa concreta. Si la métrica que de verdad mueve la aguja es el tono y no el contenido, el incentivo racional es pulir la voz del producto, su personalidad, su forma de manejar momentos de desacuerdo, antes que perseguir cada alucinación específica. No afirmo que sea lo que ocurre en los presupuestos de tal o cual compañía; afirmo que es lo que el A/B test premia y, por tanto, hacia donde empuja. Lo que esa presión protege no es la verdad del output, es la sensación del usuario. La verdad del output, en el cuadro comercial, es una propiedad secundaria del producto, importante hasta el límite en que no comprometa la sensación. Más allá de ese límite, la verdad cede.
El blog no pretende juzgar moralmente esta dinámica. La pretende nombrar. Lo que no se nombra opera sin contrapeso. Lo que se nombra, al menos, queda disponible para una conversación menos ingenua. Y la conversación pública sobre IA generativa, en su mayoría, sigue siendo una conversación sobre el contenido, no sobre el tono. Una conversación que ignora el corazón comercial del producto y discute, con seriedad universitaria, su periferia técnica.
Definiciones
- Tono comunicativo: conjunto de propiedades no propiamente informativas de un mensaje (registro, longitud, calidez, ritmo, uso de humor, gestión de la duda) que modulan la recepción del contenido en el receptor.
- A/B testing: práctica industrial consistente en exponer a dos grupos de usuarios a variantes ligeramente distintas de un producto y medir cuál produce mejor resultado en una métrica objetivo (retención, conversión, engagement).
- Sycophancy en LLM: tendencia, documentada en modelos entrenados con feedback humano, a producir respuestas que coinciden con la opinión expresada o implícita del usuario, incluso cuando esa opinión es factualmente incorrecta.
- RLHF (Reinforcement Learning from Human Feedback): técnica de afinado posterior al entrenamiento base, en la que evaluadores humanos puntúan respuestas y el modelo se ajusta para maximizar las puntuaciones obtenidas.
- Retention: en métricas de producto digital, porcentaje de usuarios que vuelven a utilizar el producto tras un periodo determinado (típicamente 1, 7 o 30 días).
Referencias
- McLuhan, M. — Understanding Media. The Extensions of Man (McGraw-Hill, 1964).
- Goffman, E. — The Presentation of Self in Everyday Life (Doubleday, 1959).
- Cialdini, R. — Influence. The Psychology of Persuasion (HarperBusiness, 1984; ed. ampliada 2021).
- Sharma, M., Tong, M., Korbak, T. et al. — Towards Understanding Sycophancy in Language Models (Anthropic). arXiv:2310.13548 (2023).
- Park, J. S., O'Brien, J., Cai, C. J., Morris, M. R., Liang, P. & Bernstein, M. S. — Generative Agents. Interactive Simulacra of Human Behavior. En Proceedings of UIST 2023. arXiv:2304.03442.
- Pearl, C. — Designing Voice User Interfaces. Principles of Conversational Experiences (O'Reilly Media, 2016). Libro técnico de la industria, no peer-reviewed.
Para profundizar
- Nass, C. & Brave, S. — Wired for Speech. How Voice Activates and Advances the Human-Computer Relationship (MIT Press, 2005). Trabajo seminal sobre cómo la voz y el tono, incluso sintéticos, activan en los humanos automatismos sociales completos: atribución de personalidad, género, simpatía, autoridad. Anterior a la generación masiva por LLM, pero conceptualmente fundacional para entender por qué el tono no es accesorio sino el canal principal por el que el modelo se inserta en la vida psicológica del usuario.
También te interesa
- La sugestión frente a la máquina
- El lenguaje imperativo encubierto
- La relación tóxica con la herramienta
- La IA como saco de boxeo

Comentarios0
Todavía no hay comentarios.
Deja un comentario