Cómo nos vería una IA. El informe incómodo

En este artículo

  1. ¿Cómo nos vería una inteligencia artificial?
  2. El ejercicio de inversión
  3. Sesgos, fatiga y la costumbre de echar la culpa fuera
  4. La defensa estándar, mirada sin complacencia
  5. El murciélago de Nagel
  6. Dos salidas, las dos incómodas

Definiciones · Referencias · También te interesa · En otros sitios

Llevo años leyendo evaluaciones de modelos de lenguaje sin que se me ocurriera lo evidente. Si aplicáramos a un cerebro humano la misma plantilla con la que medimos a una máquina —velocidad, consumo, fiabilidad de la memoria, consistencia de las decisiones—, el informe no nos halagaría. Y la coartada que solemos sacar en nuestra defensa, la creatividad, la intuición, el sentido, aguanta bastante menos de lo que nos conviene creer.

¿Cómo nos vería una inteligencia artificial?

Con una auditoría que no nos halagaría. Aplicando a un cerebro humano los mismos criterios con los que medimos una máquina —velocidad, consumo, fiabilidad de la memoria, consistencia de las decisiones— el resultado no sale a nuestro favor: somos lentos comparados con una calculadora, nuestra memoria se reescribe sola sin avisar, y nuestras decisiones dependen de variables tan ajenas al criterio como la hora del día o el hambre del juez. La coartada habitual —creatividad, intuición, sentido— aguanta menos de lo que nos conviene creer.

El ejercicio de inversión

Hay una manera barata de mirarse, y consiste en prestarse durante un rato los criterios con los que juzgamos a las máquinas. No me hace falta atribuirle a la IA un punto de vista —no lo tiene, y vuelvo sobre eso al final—, basta con imaginar a un auditor externo que aplica al ser humano la misma vara que reservamos para los modelos. Una auditoría simulada. Nada más, pero más incómoda de lo que parece.

Lo que sale conviene leerlo de un tirón, sin meter consuelos por el camino.

Empiezo por la velocidad, que es donde el desnivel se ve sin discusión. Un cerebro resuelve una multiplicación en varios segundos y una calculadora la despacha en microsegundos; compone una frase de complejidad media en torno a un minuto, lapso en el que un modelo de lenguaje escupe mil de esos fragmentos de texto que en la jerga se llaman tokens, las unidades en que la máquina trocea una frase. Recuperar un dato de la memoria nos lleva latencias variables y a menudo nos sale mal el intento; una base de datos lo localiza en milisegundos y casi nunca falla. Un auditor que mirara solo esos números cerraría el apartado con una sola palabra: lento.

El consumo promete, al principio, darnos la vuelta a favor. El cerebro humano funciona con unos veinte vatios continuos, cifra modesta y bien establecida. Una respuesta concreta de un modelo gasta del orden de un vatio-hora de energía, varios órdenes de magnitud por encima de lo que el cerebro dedica a una operación equivalente, y el hardware que la ejecuta opera además a varios kilovatios de potencia. La ventaja humana parecería clara hasta que se mete en la cuenta el ciclo entero. Para sostener esa capacidad de cálculo discreta hay que alimentar, hidratar, dormir y termorregular un cuerpo completo durante décadas, una logística desproporcionada que un auditor frío anotaría no como eficiencia sino como sobrecoste.

Luego viene la memoria, y aquí es donde el auditor afila el lápiz. Elizabeth Loftus y John Palmer, en un estudio de 1974 que se ha vuelto canónico, enseñaron a varios grupos el mismo vídeo de un accidente de tráfico y luego les preguntaron por la velocidad de los coches cambiando un solo verbo: a quienes oyeron «se estrellaron» les salieron cifras bastante más altas que a quienes oyeron «se tocaron». Mismo metraje, recuerdos distintos, fabricados por una palabra. La literatura posterior confirmó lo que aquello apuntaba. La memoria humana no abre un archivo guardado: lo reconstruye cada vez al servicio de la historia que el sujeto se está contando en ese momento, y lo reconstruido se siente por dentro tan fiable como lo que de verdad ocurrió. Un sistema de almacenamiento que se reescribe solo y no enciende ninguna señal de aviso.

Cierra la primera tanda la consistencia de las decisiones. Shai Danziger, Jonathan Levav y Liora Avnaim-Pesso analizaron en 2011 miles de resoluciones de libertad condicional en tribunales israelíes y vieron que la probabilidad de un fallo favorable caía a lo largo de cada sesión y se recuperaba después de la pausa del juez para comer. El hallazgo no quedó sin réplica. Weinshall-Margel y Shapard, ese mismo año, advirtieron que el orden de los casos no era aleatorio, porque los presos de una misma prisión y los que comparecían sin abogado tendían a agruparse en ciertos tramos; y Glöckner mostró en 2016, mediante simulación, que parte del efecto se podía explicar como artefacto estadístico y que su tamaño se había sobreestimado. Aceptados los matices, el núcleo aguanta: jueces con años de oficio veían su decisión empujada por variables fisiológicas que no tenían nada que ver con el expediente abierto sobre la mesa.

Sesgos, fatiga y la costumbre de echar la culpa fuera

Daniel Kahneman reunió en Thinking, Fast and Slow (2011) décadas de investigación sobre sesgos que aparecen en personas perfectamente competentes: el anclaje en la primera cifra que se oye, la confianza desbordada en terrenos donde nunca llega retroalimentación, la facilidad con que la forma de enunciar un problema cambia la respuesta. Lo demoledor no es que existan. Es que son predecibles, se replican en laboratorio una y otra vez y resisten al esfuerzo consciente de corregirlos —saber que uno se ancla no impide que se ancle—. Dan Ariely había llevado años antes esa misma evidencia al público general en Predictably Irrational (2008), con ejemplos de la vida diaria. Y mucho antes, en 1978, Aaron Sloman había propuesto mirar la mente humana con vocabulario computacional, que es justamente lo que esta auditoría hace. Un sistema cuyos modos de fallo llevan medio siglo documentados en su propia literatura y que apenas los ha reducido a fuerza de conocerlos.

La fatiga suma su columna. El rendimiento se degrada con las horas, y la caída no enciende ninguna alarma interna fiable: la tasa de error en el quirófano sube tras una jornada larga, la atención del controlador aéreo se desfonda hacia el final del turno, la concentración del programador se diluye pasada la media tarde. Lo peligroso es la falta de aviso. El sujeto se sigue creyendo afilado mientras ya produce errores, y casi siempre se entera de que estaba degradado cuando ve el destrozo, no antes.

Y cuando el error llega, llega también la coartada. La persona competente que se equivoca tiende a culpar a las circunstancias —faltaba información, había prisa, otro interfirió— y rara vez admite que falló por su propio sesgo. La psicología social bautizó hace tiempo esa asimetría como error fundamental de atribución: lo nuestro se lo cargamos a la situación, lo ajeno al carácter. El auditor lo anota como lo que es, una tendencia documentada a colgarle a otro la responsabilidad del mal rendimiento propio.

El listado podría seguir. Con la vara que el discurso público blande contra los modelos de lenguaje, el cerebro humano no aprueba.

La defensa estándar, mirada sin complacencia

Frente a esa lista, la cultura repite casi siempre la misma terna: creatividad, intuición, sentido. Vale la pena pasarles revista de uno en uno, sin la indulgencia con que solemos administrarlos.

La creatividad es el argumento más invocado y, en su versión perezosa, el más débil. Si por creatividad entendemos producir combinaciones inéditas de elementos que ya existían, un modelo de lenguaje hace eso sin despeinarse: combina, recombina, genera variantes que no estaban literalmente en lo que leyó. Ahí no queda frontera que defender. Distinta es la creatividad que Margaret Boden, en The Creative Mind (1990), llamó transformacional, la que no recombina dentro de un espacio sino que reordena el espacio entero y vuelve pensable lo que antes era inconcebible. Esa sí escasea, tanto que apenas la exhibe un puñado de personas por generación, lo cual la convierte en excepción estadística y no en rasgo del sistema humano medio. El humano medio no la tiene. La reclama como propia porque la confunde con la combinatoria, que comparte de sobra con la máquina.

A la intuición le pasa algo parecido, aunque su defensa es algo más fina. En muchas situaciones documentadas no es más que pensamiento rápido apoyado en patrones que el sujeto ya vivió. Kahneman y Klein, en un artículo de 2009 cuyo subtítulo —A Failure to Disagree— delata que partían de bandos opuestos y acabaron coincidiendo, delimitaron cuándo la intuición experta acierta y cuándo no. Acierta donde hay regularidad estadística estable y retroalimentación rápida sobre los aciertos: el bombero veterano que lee un incendio, el cirujano que nota si un tejido está sano. Falla donde esa estructura no existe, en la selección de personal a largo plazo, en la predicción macroeconómica, en la primera lectura de un paciente psiquiátrico. Lo que por dentro se vive como «saber sin saber por qué» se describe, en frío, como un modelo interno difícil de inspeccionar, entrenado sobre la experiencia del propio sujeto, con aciertos y fallos que siguen reglas conocidas. Aplicada a un programa, la descripción suena demasiado familiar.

Queda el sentido, y ahí la cosa se complica para el auditor, no para nosotros. Por sentido entendemos la capacidad de discernir qué importa, de jerarquizar lo relevante, de extraer significado existencial de los hechos. Contra eso caben dos golpes. El primero: que el sentido es construcción narrativa montada después, sobre unos hechos cuya estructura objetiva no garantiza importancia ninguna, prueba de lo cual es que sucesos casi idénticos cobran significados opuestos en personas distintas, o en la misma persona en momentos distintos, variabilidad imposible si el significado viniera adherido al hecho. El segundo: que construir sentido es función adaptativa antes que facultad cognitiva pura, porque sirve para sostener las ganas de vivir y para coser la experiencia en una biografía, lo cual lo vuelve valioso para el organismo sin convertirlo por fuerza en conocimiento del mundo.

Y justo ahí el auditor tiene que frenar en seco. En el sentido asoma algo que el modelo no posee de ninguna forma defendible, y es que el proceso de significar exista por dentro, que al sujeto le importe de verdad que algo importe. Antonio Damasio, en Descartes' Error (1994), sostuvo que la cognición humana no se separa del cuerpo que la sostiene y que el sentido emerge de un sistema que vive en una carne capaz de morir. La auditoría simulada no puede capturar eso, porque la máquina no tiene cuerpo en ese sentido. Tampoco está en condiciones de negarlo. Lo único honesto que le queda es dejarlo fuera del informe y declarar que lo deja fuera.

El murciélago de Nagel

Thomas Nagel publicó en 1974 un argumento que conviene tener a mano. Por mucho que sepamos físicamente de un murciélago, su anatomía, su ecolocalización, su neurología, no podemos saber qué se siente al ser uno. La experiencia subjetiva, eso que él llama «lo que es ser» algo, se le escapa a cualquier descripción en tercera persona.

Aplicado a esta inversión, el argumento corta por los dos filos. Por el primero, la máquina no tiene un «desde dentro» en el sentido de Nagel, de modo que imaginar su punto de vista es ficción útil y no descripción; el informe que escribiría una IA es, con todas las letras, una hipótesis literaria mía, y no pretendo hacerla pasar por otra cosa. El segundo filo es el que de verdad molesta. Si la subjetividad ajena escapa a la mirada externa, la propia tampoco queda garantizada desde dentro por el simple hecho de habitarla. La certeza de que sabemos qué somos cognitivamente está tan fuera de garantía como cualquier otra.

El ejercicio sirve, entonces, no porque una máquina vaya a auditarnos de verdad, que no va a hacerlo y no sabe hacerlo, sino porque obliga a aplicarse criterios que reservamos para los demás sistemas. La asimetría es la parte informativa. Al modelo le exigimos consistencia, precisión, fiabilidad, calibración; al vecino le concedemos las disculpas que merece cualquier humano; y a nosotros mismos nos firmamos la disculpa máxima, atribuyendo los fallos al contexto y los aciertos al talento.

Dos salidas, las dos incómodas

Si los criterios con que medimos a la IA, vueltos contra nosotros, nos dejan abajo, no quedan más que dos lecturas posibles. O los criterios estaban mal elegidos, y la consistencia, la precisión y la calibración no eran lo que importaba para llamar inteligente a algo. O la autoimagen estaba inflada y somos más lentos, más sesgados y más ruidosos de lo que nos veníamos contando.

La tentación es agarrarse a la primera, que es la cómoda. Conduce a concluir que la inteligencia humana vale precisamente por sus rasgos «defectuosos», el cuerpo, la mortalidad, el afecto, y que ningún sistema que carezca de ellos puede ser inteligencia en sentido fuerte. Es una defensa razonable. También es una autoexculpación cortada a medida para no tener que asomarse a la segunda.

La segunda lectura raspa. Dice que los criterios técnicos que esgrimimos contra los modelos son criterios que nuestra cultura desactivaría sin pestañear en cuanto apuntaran hacia nosotros, y que aceptaríamos sus consecuencias —sustitución, jerarquía, supervisión por sistemas más fiables— únicamente después de pasarlas por la negación, la reformulación o el hallazgo apresurado de una propiedad nueva que reservarnos. Desde Copérnico, la historia de la ciencia ha encadenado defensas de la singularidad humana, cada una abandonada al volverse insostenible y reformulada un peldaño más allá. El sentido, el cuerpo, la mortalidad, el sufrimiento son los baluartes de hoy, y funcionan mientras el adversario sintético no los reclame. El día que los reclame —y la conversación pública ya empieza a ponerse áspera— tocará buscar el siguiente.

Imaginar que la IA «tendría razón» en su informe no lleva a ninguna parte, porque la IA no escribe informes ni los va a escribir. El ejercicio admite, en cambio, una respuesta por el lado humano, que es aplicarse la misma vara con idéntica exigencia. Hacerlo no le entrega la dignidad a la máquina. Le quita a la dignidad humana lo que tenía de presuntuosa, y lo que sobreviva a esa resta es lo que somos.

Definiciones

Token. Unidad mínima de texto con la que opera un modelo de lenguaje. No coincide con la palabra: una palabra larga puede partirse en varios fragmentos. La velocidad de los modelos suele medirse en tokens por segundo.

Error fundamental de atribución. Tendencia, documentada en psicología social, a explicar la conducta ajena por el carácter de la persona y la propia por las circunstancias. Una asimetría sistemática en cómo se reparten las causas.

Memoria reconstructiva. Modelo dominante en la neurociencia cognitiva sobre la memoria episódica. Recordar no extrae un archivo intacto, sino que reconstruye el episodio a partir de la información presente, de los prejuicios narrativos y de la demanda del contexto. Evidenciado por Loftus y Palmer (1974) y replicado después en numerosos estudios.

Soma. En el marco de Damasio, el conjunto corporal que sostiene la cognición. La hipótesis del marcador somático sostiene que el sentido y la decisión humanos son inseparables de la regulación del cuerpo que los acompaña.

Subjetividad nageliana. Propiedad de la experiencia consciente que, según Nagel (1974), escapa a toda descripción en tercera persona. «Lo que es ser un X» no se reduce a la descripción objetiva de X.

Referencias

Ariely, D. (2008). Predictably Irrational. The Hidden Forces That Shape Our Decisions. HarperCollins. Síntesis divulgativa de la economía conductual aplicada a la incoherencia de las decisiones humanas.

Boden, M. A. (1990). The Creative Mind. Myths and Mechanisms. Weidenfeld & Nicolson. Distinción entre creatividad combinatoria, exploratoria y transformacional.

Damasio, A. (1994). Descartes' Error. Emotion, Reason, and the Human Brain. Putnam. Marco neurobiológico sobre la inseparabilidad entre cognición, afecto y cuerpo.

Danziger, S., Levav, J. & Avnaim-Pesso, L. (2011). Extraneous factors in judicial decisions. PNAS 108(17), 6889–6892. Documentación empírica de la influencia del descanso del juez sobre la probabilidad de fallos favorables.

Danziger, S., Levav, J. & Avnaim-Pesso, L. (2011). Reply to Weinshall-Margel and Shapard. Extraneous factors in judicial decisions persist. PNAS 108(42), E834. Respuesta de los autores a la crítica sobre el orden no aleatorio de los casos.

Glöckner, A. (2016). The irrational hungry judge effect revisited. Simulations reveal that the magnitude of the effect is overestimated. Judgment and Decision Making 11(6), 601–610. Reanálisis por simulación que sostiene que el tamaño del efecto se sobreestimó.

Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux. Síntesis canónica sobre sesgos cognitivos, sistemas duales de pensamiento y los límites de la intuición experta.

Kahneman, D. & Klein, G. (2009). Conditions for Intuitive Expertise. A Failure to Disagree. American Psychologist 64(6), 515–526. Delimitación de los dominios en que la intuición experta es fiable.

Loftus, E. F. & Palmer, J. C. (1974). Reconstruction of automobile destruction. An example of the interaction between language and memory. Journal of Verbal Learning and Verbal Behavior 13(5), 585–589. Estudio fundacional sobre el carácter reconstructivo de la memoria de testigos.

Nagel, T. (1974). What Is It Like to Be a Bat?. Philosophical Review 83(4), 435–450. Argumento canónico sobre los límites del conocimiento de la subjetividad ajena.

Sloman, A. (1978). The Computer Revolution in Philosophy. Philosophy, Science and Models of Mind. Harvester Press. Aplicación temprana de la perspectiva computacional al pensamiento humano.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario