La IA como herramienta defectuosa. Una herramienta de otra categoría

En este artículo

  1. El martillo, el coche y la confianza por uso
  2. El LLM, el martillo que a veces martillea con elocuencia
  3. El usuario que confunde categoría
  4. Lo que los frameworks intentan modelar y donde se quedan cortos
  5. La trampa del human-in-the-loop
  6. La categoría correcta aún no existe
  7. La cuarta cosa sin nombre

Definiciones · Referencias · También te interesa · En otros sitios

Las herramientas tradicionales fallan de formas predecibles: el martillo se rompe por la cabeza, la sierra se desafila con el uso, el coche pita el aceite. La IA falla de formas inesperadas: alucina nombres, contradice una afirmación que hizo dos turnos antes, repite con seguridad un dato erróneo, halaga al usuario para mantenerlo. No es una herramienta peor. Es una herramienta de otra categoría — y no la hemos clasificado todavía. Mientras tanto, la legislación de productos y el sentido común del usuario operan con la categoría equivocada.

El martillo, el coche y la confianza por uso

Una de las cosas que damos por supuestas con las herramientas tradicionales es que aprendemos a confiar en ellas usándolas. El proceso es informal y eficaz. Coges un martillo, lo usas durante semanas, te haces a su peso, ves cómo se desgasta el mango. Cuando el martillo va a fallar, normalmente avisa: una grieta, un crujido, una holgura. El fallo es gradual, observable, predecible. La confianza que ganas con el uso es proporcional al tiempo que llevas sin que la herramienta te traicione, y la traición, cuando llega, suele anunciarse con señales que tu cerebro ya sabe leer.

El coche es la versión sofisticada del mismo patrón. Un coche falla en partes, no entero. El motor empieza a hacer un ruido raro semanas antes de la avería seria. Los frenos chirrían antes de no frenar. El testigo del aceite parpadea. La cultura del taller, los protocolos de revisión periódica, las garantías legales del fabricante, todo lo que envuelve al coche está construido sobre la premisa de que los modos de fallo son finitos, conocidos y, en buena medida, detectables antes del fallo. Cuando un coche falla de forma imprevista — el caso de la aceleración no deseada de Toyota, donde un jurado de Oklahoma City concluyó en 2013, en el pleito Bookout contra Toyota, que el software de la unidad de control electrónico del acelerador presentaba defectos — se abre una investigación que tarda años y termina en litigio o cambio normativo. El fallo imprevisto es, por sí mismo, un escándalo.

Esta arquitectura de confianza, lentamente construida durante dos siglos de industrialización, está incorporada a nuestra intuición de qué es una herramienta. La intuición es razonable. Es la que también aplicamos al software clásico, que falla de forma reproducible: un bug es un bug, se detecta, se documenta, se corrige.

El LLM, el martillo que a veces martillea con elocuencia

Los modelos de lenguaje fallan de un modo que no encaja en esa intuición. Su fallo es estocástico: no se reproduce idénticamente. Es ocasional: la mayor parte del tiempo el output es razonable, y el fallo aparece sin previo aviso. Es, lo más incómodo, superficialmente indistinguible del acierto: el texto alucinado tiene la misma fluidez, la misma sintaxis correcta, la misma confianza tonal que el texto correcto.

Ji y otros, en Survey of Hallucination in Natural Language Generation (ACM Computing Surveys 55(12), 2023), publicaron una taxonomía detallada de los modos de fallo y reportaron tasas según modelo y dominio. La cifra agregada no es lo importante; lo importante es la propiedad estructural que documentan: en los modelos generativos, la alucinación no es residuo a corregir. Es propiedad del aparato. Un modelo que produce texto plausible sobre un dominio dado lo hace muestreando de una distribución aprendida; cuando la consulta cae en una zona del espacio donde la distribución es ambigua, el muestreo produce salida plausible aunque no esté anclada en datos. El modelo no «sabe» que está alucinando porque no tiene mecanismo interno de distinguir lo que sabe de lo que generó por coherencia local.

Esto produce una fenomenología del fallo nueva. El martillo, cuando va a fallar, hace ruido. El LLM, cuando va a fallar, escribe mejor que nunca. La elocuencia es la propiedad común, no la señal de alarma. Marcus y Davis, en Rebooting AI (Pantheon, 2019), avisaron antes del despliegue comercial masivo: la fluidez sin anclaje semántico produce errores convincentes, y la convicción del error es función creciente de la calidad superficial del sistema.

El usuario que confunde categoría

Aplicar a un LLM la heurística que usamos con un martillo no funciona. Si lo usas durante semanas y no te traiciona, no puedes deducir que no te va a traicionar. La traición no se acumula en señales detectables, aparece aleatoriamente. Lo que el uso prolongado te da es una confianza basada en muestra pequeña sobre una distribución cuya cola contiene los fallos que importan: justo los datos que ibas a usar para algo que no podías verificar tú mismo.

El usuario medio — porque esto no es problema del usuario tonto, es problema de cualquier usuario humano cuya intuición de herramienta venga del mundo físico — opera con la categoría equivocada. Pide al LLM una bibliografía y recibe títulos plausibles con autores reales y editoriales reales, y la fluidez de la respuesta refuerza la confianza, hasta que va a buscar el ISBN y descubre que el libro no existe. Pide al LLM un cálculo legal y recibe un razonamiento articulado que cita artículos verídicos en una jurisdicción equivocada, y la articulación refuerza la confianza, hasta que el caso pasa al tribunal y el tribunal sanciona al abogado.

La trampa cognitiva es persistente. Una vez aceptada la categoría «herramienta», la mente humana le aplica el patrón de fiabilidad creciente con el uso. Y ese patrón es, aquí, falso por construcción. Cada interacción es independiente. La fiabilidad de la última respuesta no predice la fiabilidad de la siguiente, salvo en agregado estadístico que el usuario individual no puede observar.

Lo que los frameworks intentan modelar y donde se quedan cortos

NIST publicó el AI Risk Management Framework (AI RMF) como respuesta normalizadora al problema. ISO/IEC 42001:2023 estableció un sistema de gestión para organizaciones que despliegan IA. Ambos son intentos serios y conviene reconocerlo. El AI RMF tipifica riesgos por categoría — bias, drift, hallucination, security — y propone prácticas de mitigación. ISO 42001 ordena procesos. Lo que ninguno hace, porque ningún framework de gestión puede hacerlo todavía, es resolver la asimetría fundamental: el fallo no se anuncia en la salida, y la mitigación por proceso descansa en supervisión humana que tiende a no ver el fallo cuando el fallo es elocuente.

La Unión Europea ha dado un paso adicional con la Directiva (UE) 2024/2853 sobre responsabilidad por productos defectuosos, en vigor desde diciembre de 2024 y aplicable a productos puestos en el mercado a partir del 9 de diciembre de 2026. La novedad relevante: software, firmware, aplicaciones y sistemas de IA están explícitamente cubiertos como producto a efectos de responsabilidad civil. Es una decisión importante. Trae al fabricante de IA al régimen estricto de responsabilidad de producto, con obligación de mantener actualizado el producto y de evitar defectos por la duración esperable.

La duda razonable, mirando la directiva con cariño, es si la categoría «producto» captura lo que un LLM hace. Un producto defectuoso clásico es aquel cuyo fallo se puede describir como divergencia respecto a su especificación. Un LLM no tiene especificación verificable de output en el sentido tradicional; su salida es distribución probabilística, y cualquier salida concreta puede argumentarse como muestra legítima de esa distribución. La directiva tendrá que tener jurisprudencia que decida qué cuenta como defecto en este régimen, y esa jurisprudencia llegará después de varios casos llamativos.

La trampa del human-in-the-loop

Hay una expresión que el sector repite como amuleto: human in the loop. La idea es que la mitigación de los riesgos de la IA pasa por mantener un humano supervisando la decisión automática. Suena razonable. La operativa real tiene un problema medido.

Green y Chen, en Disparate Interactions. An Algorithm-in-the-Loop Analysis of Fairness in Risk Assessments (FAT 2019), estudiaron casos reales de evaluación de riesgo con sistema automático y supervisión humana. Lo que encontraron va contra la intuición optimista del human in the loop*: el humano supervisor refuerza, en lugar de mitigar, las disparidades del sistema. La razón no es maldad del supervisor. Es economía cognitiva. Un humano que revisa miles de outputs de un sistema cuya tasa de acierto agregada es alta acaba aceptando la salida por defecto y reservando su atención sólo para los casos que le suenan raros. Y «raro» no coincide con «erróneo». Los errores elocuentes no suenan raros. Pasan limpios.

Madras, Pitassi y Zemel, en Predict Responsibly. Improving Fairness and Accuracy by Learning to Defer (NeurIPS 2018), propusieron un diseño formal del «defer to human» como decisión explícita del sistema, no como parche organizativo. La propuesta es razonable y conviene leerla. Lo que no resuelve, porque ningún diseño técnico la resuelve, es la asimetría informativa que el supervisor humano sufre: ve la salida, no ve la cadena de pasos internos que llevó a esa salida. Cuando la salida es elocuente, la cadena de pasos invisible parece sólida. El supervisor está supervisando la apariencia, no el funcionamiento.

La categoría correcta aún no existe

Tres categorías clásicas hay para clasificar lo que produce decisiones en el mundo: herramienta, profesional, agente jurídico. La IA contemporánea, mirada honestamente, no encaja del todo en ninguna.

No es herramienta clásica porque su fallo es estocástico, elocuente y no se anuncia. La intuición de fiabilidad-por-uso no se aplica.

No es profesional porque no tiene voz, contexto situado, ni responsabilidad. La intuición de delegación entre iguales no se aplica.

No es agente jurídico porque no tiene personalidad jurídica, ni patrimonio embargable, ni capacidad de comparecer. La intuición de responsabilidad imputable no se aplica.

La cuarta cosa sin nombre

Hay una cuarta cosa que el lenguaje todavía no nombra y que ya está incorporada al flujo profesional, judicial, médico, educativo y administrativo de medio mundo. La industria opera en esa ausencia de nombre y se beneficia de ella. Si la cosa fuera definitivamente herramienta, el régimen de producto la mordería entera. Si fuera definitivamente profesional, las colegiaciones la mordieran entera. Si fuera definitivamente agente, el derecho mercantil la mordería entera. Como no es claramente ninguna, ninguna la muerde del todo, y la diferencia se convierte en margen de explotación.

Bender y otras, en Stochastic Parrots (FAccT 2021), planteaban ya entonces que parte de la conversación pública sobre IA tenía que pasar antes por una decisión política sobre qué tipo de cosa es esto. La decisión no se ha tomado. La industria avanza, las regulaciones intentan adaptarse, los frameworks normalizan, los usuarios usan, y la categoría correcta sigue sin existir. Mientras siga sin existir, el sintagma «herramienta defectuosa» seguirá describiendo bien lo que vemos sin describir bien lo que es.

Definiciones

Alucinación (hallucination). Salida generada por un modelo de lenguaje que contiene afirmaciones plausibles pero factualmente erróneas, sin que el modelo señale incertidumbre. Es propiedad estructural del muestreo en distribuciones aprendidas, no defecto residual corregible.

NIST AI Risk Management Framework. Marco voluntario publicado por NIST en 2023 para identificar y mitigar riesgos asociados al despliegue de sistemas de IA. Tipifica riesgos pero no resuelve la asimetría fundamental entre fallo invisible y supervisión humana.

ISO/IEC 42001:2023. Estándar internacional para sistemas de gestión de IA en organizaciones. Orienta el proceso; no certifica la fiabilidad del output del modelo.

Directiva (UE) 2024/2853. Nueva Directiva de la UE sobre responsabilidad por productos defectuosos, en vigor desde diciembre de 2024 y aplicable a productos puestos en el mercado desde diciembre de 2026. Incluye software y sistemas de IA como producto a efectos de responsabilidad civil.

Human in the loop. Patrón organizativo según el cual un supervisor humano revisa la salida de un sistema automático antes de que tenga efecto. Mitiga algunos modos de fallo y, según Green y Chen (2019), refuerza otros — particularmente los asociados a errores elocuentes.

Referencias

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021.

Bookout v. Toyota Motor Corp. (2013). District Court of Oklahoma County, Oklahoma City. Veredicto del jurado, anterior al acuerdo extrajudicial, que halló defectuoso el software de la unidad de control electrónico del acelerador de Toyota en un caso de aceleración no deseada. Conviene matizar que las investigaciones de la NHTSA y la NASA (2010-2011) atribuyeron la mayoría de incidentes de aceleración a alfombrillas y pedales; el hallazgo sobre el software corresponde específicamente a este pleito. Recogido en cobertura de prensa especializada (CNN, EE Times).

Directiva (UE) 2024/2853 del Parlamento Europeo y del Consejo, de 23 de octubre de 2024, relativa a la responsabilidad por los daños causados por productos defectuosos. Cubre explícitamente software, firmware y sistemas de IA.

Green, B. & Chen, Y. (2019). Disparate Interactions. An Algorithm-in-the-Loop Analysis of Fairness in Risk Assessments. FAT* 2019. Estudio sobre el efecto real del supervisor humano sobre la equidad de sistemas de evaluación de riesgo.

Ji, Z. et al. (2023). Survey of Hallucination in Natural Language Generation. ACM Computing Surveys 55(12), 1–38. Taxonomía detallada de modos de fallo en generación natural y tasas comparadas por modelo y dominio.

Madras, D., Pitassi, T. & Zemel, R. (2018). Predict Responsibly. Improving Fairness and Accuracy by Learning to Defer. NeurIPS 2018. Diseño formal del «defer to human» como decisión explícita del sistema.

Marcus, G. & Davis, E. (2019). Rebooting AI. Building Artificial Intelligence We Can Trust. Pantheon. Advertencia temprana sobre los errores convincentes y la inadecuación de la categoría «herramienta» para los sistemas generativos.

NIST AI Risk Management Framework. (2023). National Institute of Standards and Technology. Marco voluntario para gestión de riesgos asociados al despliegue de sistemas de IA.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario