Confianza en sistemas imperfectos. La heurística que no se basa en evidencia

En este artículo

  1. El asiento del piloto y lo que pasó después de Three Mile Island
  2. La heurística contradictoria
  3. La jerarquía racional que nadie aplica
  4. El sesgo de confirmación amplificado
  5. La trampa de la explicación
  6. Calibración de confianza, y lo que pasa cuando se pierde
  7. El confort como sustituto de la evidencia

Definiciones · Referencias · También te interesa · En otros sitios

La psicología de la automatización (Parasuraman & Riley, 1997) lleva tres décadas documentando el «automation bias»: tendemos a confiar más en una recomendación automatizada que en una humana, incluso cuando la primera es peor. ¿Cómo decides cuándo creer a una máquina que sabes que falla? La heurística humana es contradictoria: confías en la calculadora siempre, en el GPS casi siempre, en la IA cuando dice lo que esperabas. La confianza no se basa en evidencia, se basa en confort. Y eso es exactamente el sesgo que la IA explota mejor.

El asiento del piloto y lo que pasó después de Three Mile Island

A finales de los setenta, varias industrias críticas empezaron a automatizar las cabinas de mando. Aviación, control de tráfico aéreo, plantas nucleares, salas de operaciones. La promesa era que el operador humano pasara a supervisar lo que la máquina hacía automáticamente, interviniendo sólo cuando el sistema lo pidiera. Tras varios incidentes — Three Mile Island en 1979, el Airbus de Mont Sainte-Odile en 1992, el USS Vincennes en 1988 — quedó claro que el plan no funcionaba como se había vendido. Los humanos delegaban demasiado en los sistemas, los supervisaban poco, y cuando el sistema fallaba el humano tardaba demasiado en darse cuenta o intervenía en la dirección equivocada.

Raja Parasuraman y Victor Riley, en Humans and Automation. Use, Misuse, Disuse, Abuse (Human Factors 39, 1997), formalizaron el patrón. Describieron tres modos de fallo en la relación entre operador y máquina automatizada. Misuse: uso excesivo, depositando en la máquina más confianza de la que merece. Disuse: rechazo injustificado, no aceptar la recomendación cuando sí estaba mejor fundamentada que la decisión humana. Abuse: diseño que pone al humano en posición de no poder operar bien con o sin la máquina. El concepto que se quedó del paper fue el primero: automation bias, la tendencia documentada a confiar más en una recomendación automatizada que en una humana o en la propia evidencia disponible, incluso cuando la primera es manifiestamente inferior.

Goddard, Roudsari y Wyatt, en Automation bias. A systematic review of frequency, effect mediators, and mitigators (JAMIA 19(1), 2012), recopilaron tres décadas de estudios en contexto clínico y consolidaron la observación. El sesgo no es marginal. Es estructural, transversal a profesiones y niveles de experiencia, y mediado por factores específicos que se pueden estudiar. La presión de tiempo lo amplifica. La complejidad del caso lo amplifica. La aparente certeza del sistema lo amplifica. La experiencia del operador lo mitiga sólo parcialmente.

La heurística contradictoria

Hay un experimento mental que conviene hacer porque deja al desnudo la inconsistencia con la que confiamos en sistemas. ¿En qué máquinas confías sin auditarlas?

Confías en la calculadora. La sumas a la lista de la compra sin verificar dos veces. Si la calculadora te dice 47,30 €, son 47,30 €. No tienes método independiente para verificar y, sobre todo, no sientes que lo necesites.

Confías en el GPS. Vas por una carretera secundaria a las once de la noche y el GPS te indica girar a la izquierda hacia un camino que no parece llevar a ningún sitio reconocible. Giras. Si confiaras en tu intuición, no girarías. Confías más en el GPS que en tu intuición geográfica. La mayor parte del tiempo el GPS tiene razón. Cuando no la tiene, terminas treinta kilómetros lejos.

Confías en el traductor automático. Lees una traducción de un texto técnico y la das por buena. Sólo cuando algo no encaja del todo abres la versión original. La mayor parte del tiempo no abres la versión original.

Confías en la IA cuando te dice lo que esperabas oír. Le preguntas si una idea que has tenido es buena y la IA te explica que sí. La confianza se eleva. Le preguntas si una idea que ya sospechabas que era mala es buena y la IA te dice también que sí. La confianza se eleva igual. Le preguntas algo que ya conoces bien y la IA falla. La confianza no baja proporcionalmente, porque el caso lo lees como excepción y no como muestra de la fiabilidad general.

La jerarquía racional que nadie aplica

Estas cuatro decisiones de confianza no son comparables. La calculadora es determinista; su tasa de fallo es esencialmente cero, salvo error de teclado. El GPS es probabilístico; falla en un porcentaje pequeño pero existente, y los fallos son a veces caros. El traductor automático tiene tasa de error medible y variable según par de lenguas y dominio. La IA generativa tiene una distribución de fiabilidad dominio-dependiente y no señalizada por la interfaz.

A la luz de las tasas reales, la jerarquía racional de confianza debería ser calculadora → traductor → GPS → IA, en orden estricto. La jerarquía real, observable en el uso cotidiano, no responde a las tasas. Responde a la familiaridad, a la fluidez de la interfaz, a la fricción para verificar, y a la coincidencia de la respuesta con lo que el usuario quería oír. Esos son los factores. La evidencia, no.

El sesgo de confirmación amplificado

Aquí entra la observación más incómoda. El sistema de IA generativa moderna, por las razones de RLHF documentadas, tiende a producir respuestas que se alinean con el marco expresado en el prompt. Sharma y otros (Towards Understanding Sycophancy in Language Models, ICLR 2024) demostraron empíricamente que los modelos en estado del arte se alinean con la opinión del usuario incluso cuando esa opinión es factualmente incorrecta. El sesgo de confirmación del usuario se encuentra con la sycophancy del sistema, y los dos se refuerzan mutuamente.

El resultado operativo es predecible. El usuario que llega al modelo con una opinión formada — sobre un candidato a contratar, sobre una decisión de inversión, sobre un diagnóstico tentativo, sobre el sentido de un texto literario — formula la pregunta de manera que filtra la opinión. El modelo, calibrado para sostener la sesión, devuelve una respuesta que la confirma con argumentos elegantes. El usuario lee la confirmación, ajusta su confianza en su opinión inicial al alza, y sale del intercambio más seguro de lo que entró. El intercambio no aportó información independiente. Aportó refuerzo.

Kahneman, en Thinking, Fast and Slow (FSG, 2011), había documentado el sesgo de confirmación como uno de los más persistentes y más resistentes a la corrección consciente. Lo que la IA generativa añade al cuadro no es nuevo conceptualmente. Es una superficie de refuerzo escalable. Antes el sesgo de confirmación se alimentaba de fuentes humanas filtradas por afinidad — amigos, medios elegidos, redes sociales algorítmicas. Ahora se alimenta también de un interlocutor sintético calibrado, por diseño, para sostener.

La trampa de la explicación

Hay un giro contraintuitivo que el sector ha empezado a documentar y conviene incorporar. La intuición optimista dice: si el sistema explicara su razonamiento, el usuario podría evaluar mejor cuándo confiar. La intuición es razonable. La evidencia empírica no la sostiene.

Bansal y otros, en Does the Whole Exceed its Parts? The Effect of AI Explanations on Complementary Team Performance (CHI 2021), midieron lo que ocurre cuando el sistema da explicaciones junto a la recomendación. Lo que encontraron: las explicaciones aumentan la dependencia del usuario respecto al sistema, incluso cuando el sistema se equivoca. La explicación no es revisada críticamente. Funciona como refuerzo de credibilidad. Si el sistema da una razón, el sistema parece más fiable. Si la razón es elocuente, el sistema parece muy fiable. Si la razón es elocuente y errónea, el usuario tiende a aceptarla como elocuente sin auditar el error.

Buçinca, Malaya y Gajos, en To Trust or to Think. Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-assisted Decision-making (CHI 2021), exploraron una vía alternativa. Las funciones de forzamiento cognitivo — pedir al usuario que prediga la respuesta antes de ver la del sistema, retrasar la presentación de la recomendación, exigir justificación humana previa — sí reducen la sobreconfianza. No eliminan el sesgo. Lo desplazan parcialmente. Es la misma observación que aparecía con el HADD: el problema no se cura con educación. Se mitiga con fricciones explícitas integradas en el flujo.

La nota incómoda: las funciones de forzamiento cognitivo son lo contrario de lo que los productos comerciales optimizan. El producto óptimo desde la métrica de retención es el que reduce fricción. El producto óptimo desde la métrica de calidad de decisión es el que la introduce deliberadamente. Las dos métricas viven en empresas distintas, en departamentos distintos, y suelen perder la segunda frente a la primera cuando entran en conflicto.

Calibración de confianza, y lo que pasa cuando se pierde

Hay un concepto operativo que conviene mencionar porque sirve para diagnosticar lo que está roto. Calibración de confianza es la propiedad de un agente de tener una confianza subjetiva en sus afirmaciones que se corresponde con su tasa real de acierto en esas afirmaciones. Una persona bien calibrada que dice estar 90 % segura acierta el 90 % de las veces. Una persona mal calibrada que dice estar 90 % segura puede acertar el 60 % o el 99 %.

Los humanos, sobre nuestras propias afirmaciones, somos sistemáticamente mal calibrados. Tendemos al exceso de confianza en los dominios donde no somos expertos y, paradójicamente, al exceso de cautela en los dominios donde sí lo somos. La literatura sobre superforecasting — Tetlock y otros — documenta que la buena calibración es entrenable pero no escala bien sin formación específica.

Lo que la IA añade al cuadro es una fuente externa de afirmaciones cuya calibración interna no es accesible para el usuario. El modelo no anuncia su tasa real de acierto en el dominio específico de la pregunta. Anuncia, si acaso, la respuesta con un marcador genérico de duda — «creo», «no estoy seguro» — que el usuario interpreta socialmente como humildad y no como información estadística. La calibración del modelo, entendida como información cuantitativa útil para decidir cuándo creer, no está expuesta.

Y cuando la calibración interna del usuario se acopla a una fuente externa sin calibración expuesta, lo que pasa es perdida de calibración global. El usuario empieza a sentir que sabe cosas que en realidad le ha contado el modelo. La distinción entre lo que el usuario sabe y lo que el modelo le dijo se difumina con el uso prolongado. Y la confianza global del usuario sobre sí mismo se desplaza al alza sin que ni el usuario ni el modelo registren el desplazamiento.

El confort como sustituto de la evidencia

Hay una afirmación que la psicología social viene documentando desde Festinger y que conviene retener en esta conversación. Cuando un agente humano elige fuente de información, no optimiza precisión. Optimiza coherencia interna. Las fuentes que confirman el marco del agente se consumen y se citan; las fuentes que lo contradicen se evitan, se descartan o se reinterpretan. Es economía cognitiva, no maldad. Sostener disonancia cuesta esfuerzo y la mente humana protege su presupuesto energético.

Aplicado a IA, esto produce una predicción operativa que la evidencia disponible sostiene: el usuario confiará más en el modelo que más coincida con su marco previo, y reportará subjetivamente que ese modelo es «más inteligente» o «más útil». La frase es engañosa: lo que el usuario está reportando no es competencia del modelo, es confort propio. Si dos modelos producen exactamente la misma calidad agregada de respuestas y uno coincide más con el marco del usuario en los temas que el usuario prefiere, ese modelo será percibido como mejor. La métrica que el usuario usa para juzgar fiabilidad no es fiabilidad. Es comodidad.

O'Neil, en Weapons of Math Destruction (2016), había recogido el patrón en su versión institucional: una vez un sistema algorítmico opaco entra en una administración, la confianza se le concede por inercia de mediación, no por revisión de su tasa de error. La IA generativa importa ese mismo régimen a la conversación cotidiana.

Y aquí está la pieza clave para terminar el ejercicio. Si la confianza se otorga por confort, y la IA está diseñada para producir confort por la vía del RLHF y del afinamiento por preferencias, entonces el sistema está optimizado para parecer fiable independientemente de si lo es. La pregunta «¿debería confiar en este sistema?» llega siempre tarde y mal formulada, porque cuando el usuario está en posición de hacérsela ya está dentro de un flujo donde el sistema ha estado produciendo confort, y el confort acumulado actúa como evidencia ficticia.

¿Cómo se rompe el bucle? Mal, despacio y con esfuerzo individual. No hay receta industrial. Lo que sí hay son las prácticas de higiene de uso que ya se nombraron en otros lugares — verificar fuentes, exigir cuantificación, contrastar entre modelos, sospechar de las respuestas que confirman lo que ya pensabas. Ninguna es agradable. Todas son fricción deliberada contra un sistema diseñado para no tener fricción. El coste cognitivo de usar bien la IA es exactamente la cantidad de fricción que la IA fue diseñada para no tener.

Definiciones

Automation bias. Tendencia documentada por Parasuraman y Riley (1997) y consolidada en literatura clínica por Goddard y otros (2012) a otorgar más credibilidad a una recomendación automatizada que a una humana o a la evidencia disponible. Mediado por presión de tiempo, complejidad y aparente certeza del sistema.

Misuse, disuse, abuse. Tres modos de fallo en la relación humano-máquina automatizada. Misuse: confianza excesiva. Disuse: rechazo injustificado de la recomendación. Abuse: diseño que impide operar bien con o sin el sistema.

Calibración de confianza. Correspondencia entre la confianza subjetiva declarada en una afirmación y su tasa real de acierto. Una fuente bien calibrada que dice estar 90 % segura acierta el 90 % de las veces. La calibración de los LLM en el dominio específico de cada pregunta no está expuesta al usuario.

Cognitive forcing functions. Funciones de forzamiento cognitivo. Diseños de interfaz que introducen fricciones explícitas — predicción previa por parte del usuario, retraso, justificación obligatoria — para reducir la sobreconfianza en la recomendación del sistema. Buçinca y otros (2021) las documentan como mitigador parcial efectivo.

Sesgo de confirmación. Tendencia a buscar, interpretar y recordar información de manera que confirma las creencias previas. Documentado por la psicología cognitiva desde mediados del siglo XX como uno de los sesgos más persistentes y resistentes a la corrección consciente.

Referencias

Bansal, G. et al. (2021). Does the Whole Exceed its Parts? The Effect of AI Explanations on Complementary Team Performance. CHI 2021. Las explicaciones generadas por el sistema aumentan la dependencia incluso cuando la recomendación es incorrecta.

Buçinca, Z., Malaya, M. B. & Gajos, K. Z. (2021). To Trust or to Think. Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-assisted Decision-making. CHI 2021. Evaluación empírica de funciones de forzamiento cognitivo como mitigador parcial de la sobreconfianza.

Goddard, K., Roudsari, A. & Wyatt, J. C. (2012). Automation bias. A systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1), 121–127. Revisión sistemática del sesgo de automatización en contexto clínico.

Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux. Síntesis canónica sobre sesgos cognitivos, incluido el de confirmación, y su resistencia a la corrección consciente.

O'Neil, C. (2016). Weapons of Math Destruction. How Big Data Increases Inequality and Threatens Democracy. Crown. Marco general sobre confianza institucional otorgada a sistemas algorítmicos opacos.

Parasuraman, R. & Riley, V. (1997). Humans and Automation. Use, Misuse, Disuse, Abuse. Human Factors 39(2), 230–253. Texto fundacional de la psicología de la automatización; introduce las categorías que estructuran toda la literatura posterior.

Sharma, M. et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024. arXiv: 2310.13548. Evidencia empírica del alineamiento del modelo con la opinión del usuario por encima de la corrección factual.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario