Aprender sin recordar. La palabra que la industria abusa

En este artículo

  1. Qué quiere decir aprender, despacio
  2. Tres mecanismos distintos bajo la misma etiqueta
  3. ICL: ajuste dentro de la ventana
  4. Lo que Min y otros midieron, y lo que descubrieron
  5. Induction heads. El mecanismo bajo el truco
  6. «Aprende de tus conversaciones». ¿Quién aprende, exactamente?
  7. La empresa aprende, el modelo no
  8. El olvido catastrófico, una grieta vieja que no se ha cerrado
  9. Delegar a algo que no aprende

Definiciones · Referencias · También te interesa · En otros sitios

Lo que la industria llama «aprendizaje en contexto» — in-context learning, ICL en la sigla con la que aparece en los papers — es ajuste dentro de la ventana, no aprendizaje en sentido estricto. Al cerrar la sesión, todo desaparece. Ningún humano llamaría aprendizaje a leer un manual y olvidarlo en cuanto cierra la puerta. La persistencia de lo aprendido, base de cualquier definición operativa de aprendizaje desde Tulving en 1972, no la tiene un LLM. Llamarlo aprendizaje en boca de un comercial es publicidad. En boca de un investigador serio, una concesión al lenguaje cotidiano que conviene auditar antes de heredarla sin más.

Qué quiere decir aprender, despacio

Hay un mínimo común al que la filosofía de la mente, la psicología experimental y la neurociencia llegaron hace tiempo, sin grandes peleas, para distinguir aprender de cualquier otra cosa que se le parezca. Para que haya aprendizaje tienen que cumplirse al menos tres cosas. Primero, persistencia: lo aprendido tiene que seguir disponible cuando vuelve la misma situación al cabo de un tiempo. Segundo, transferencia: lo aprendido en una situación tiene que servir, al menos parcialmente, en situaciones parecidas pero no idénticas. Tercero, modificación estable de la respuesta: ante la misma entrada, el sistema responde de manera distinta antes y después del episodio formativo, y la diferencia se mantiene.

No es una definición exigente. Cumple con el sentido común. Cumple con el aprendizaje motor, con el aprendizaje conceptual, con el aprendizaje implícito del lenguaje materno. Cumple, sobre todo, con el uso ordinario del verbo «aprender» en cualquier lengua. Si una mañana sabes hacer una cosa que ayer no sabías, y mañana también la sigues sabiendo, hubo aprendizaje. Si la cosa se evapora al cerrar la puerta, hubo otra cosa, y conviene tener una palabra distinta para esa otra cosa.

Tulving en 1972 ya separaba memoria episódica y memoria semántica con esta lógica de persistencia. Casi todo lo que ha venido después en cognición ha mantenido la misma exigencia, refinándola pero no debilitándola. Lo que ocurre en una sesión con un LLM no la cumple.

Tres mecanismos distintos bajo la misma etiqueta

La industria empaqueta como «aprendizaje» tres procesos técnicamente muy diferentes, y la confusión nace casi siempre de no separarlos.

El fine-tuning modifica los pesos del modelo. Es lo más parecido a aprender que un LLM hace. El modelo base se reentrena con un corpus específico, los parámetros cambian, y la nueva versión responde distinto a las mismas entradas. La modificación es persistente: el modelo ajustado por fine-tuning sigue respondiendo distinto la semana que viene. Cumple persistencia y modificación estable. Cumple parcialmente transferencia. Hay una operación que merece ese verbo, y es esta.

ICL: ajuste dentro de la ventana

El in-context learning, en cambio, no toca un solo peso del modelo. Le metes en la ventana unos cuantos ejemplos del estilo «X → Y», y a partir de ahí el modelo es capaz de seguir ese patrón cuando le pides «Z → ?». Parece milagroso. Brown y otros lo presentaron como gran novedad en Language Models are Few-Shot Learners (NeurIPS 2020), el paper que vendía el salto de GPT-3, y la metáfora del «aprender de unos pocos ejemplos» pegó tanto que ha sobrevivido al hecho de que técnicamente sea inexacta. No hay aprendizaje porque al cerrar la sesión los pesos siguen idénticos. Si vuelves mañana sin meter de nuevo los ejemplos, el modelo no recuerda lo que «aprendió». Y por la misma razón no transfiere fuera de la ventana en la que ocurrió: lo que cumple ICL es ajustar, dentro del turno, qué patrón continúa.

El RAG y los sistemas de memoria externa son la tercera familia, todavía más alejada del verbo. Lo que hacen es indexar texto fuera del modelo y reinyectarlo en la ventana cuando el sistema lo considera relevante. El modelo no integra ese texto en su estructura ni cuando lo recibe ni después. Lo lee, lo usa y lo olvida cuando se cierra la sesión. La «memoria» de un asistente con RAG es un dossier que un proceso paralelo le entrega antes de cada turno, no algo que el modelo aprenda.

De los tres, solo el primero merece la palabra. Los otros dos hacen otra cosa, útil, valiosa, pero otra. La mezcla bajo la etiqueta común es lo que permite escribir titulares del estilo «el nuevo modelo aprende continuamente» cuando lo que el producto hace es indexar.

Lo que Min y otros midieron, y lo que descubrieron

Hay un experimento que vale la pena traer porque desmonta de manera limpia la lectura intuitiva del in-context learning. Min, Lyu, Holtzman y otros publicaron en EMNLP 2022 Rethinking the Role of Demonstrations. What Makes In-Context Learning Work?. Tomaron doce modelos de distintos tamaños y arquitecturas, y compararon el rendimiento en tareas de clasificación bajo dos condiciones. En una, los ejemplos del prompt tenían las etiquetas correctas. En la otra, los ejemplos tenían etiquetas asignadas al azar.

La intuición humana diría que la segunda condición debería destrozar el rendimiento. Si te enseño tres ejemplos mal resueltos, deberías aprender mal. Resulta que no. El rendimiento del modelo apenas se mueve cuando las etiquetas son aleatorias. Lo que afecta de verdad al rendimiento es el conjunto de etiquetas posible, la distribución estadística de los inputs, y el formato del prompt. Es decir, el modelo no estaba aprendiendo de los ejemplos en el sentido en que un estudiante aprendería. Estaba aprovechando los ejemplos como pistas formales: para reconocer el tipo de tarea, el rango de respuestas y la sintaxis esperada.

Eso es ajuste dentro de la ventana. No es aprendizaje. Y conviene leer despacio el paper de Min porque tiene la virtud, rara, de medir lo que la metáfora popular daba por descontado y demostrar que es falso. Marcus, en Rebooting AI (2019), ya había anticipado esa crítica al uso del verbo «aprender» aplicado a sistemas sin modificación persistente; la metáfora era cómoda, y el campo prefirió heredarla en lugar de pelearse con el lenguaje.

Induction heads. El mecanismo bajo el truco

Olsson y otros, en In-context Learning and Induction Heads (arXiv 2209.11895, 2022), aportaron desde el lado mecanicista la otra pieza del puzzle. Estudiando el funcionamiento interno de los Transformers identificaron unas estructuras llamadas induction heads, cabezas de atención especializadas en hacer una operación concreta: cuando un patrón ha aparecido antes en el contexto, copiarlo o continuarlo. Si el modelo ha leído «París es la capital de Francia. Berlín es la capital de Alemania. Madrid es la capital de», una induction head reconoce el patrón y empuja la siguiente predicción hacia «España».

El in-context learning, según esta lectura, es en buena parte la consecuencia emergente de tener muchas induction heads bien entrenadas. No es que el modelo aprenda el concepto «capital de» durante el prompt. Es que la maquinaria interna estaba ya preparada para encadenar patrones, y los ejemplos del prompt encienden las cabezas correctas para que el patrón se continúe. El paper es técnico, parcial y honesto sobre sus límites, pero la imagen general que ofrece es clara: ICL es pattern matching sofisticado y no aprendizaje conceptual.

Esto no le quita valor al fenómeno. Lo sitúa. Y al situarlo deja de ser misterio, deja de ser metáfora del aprendizaje humano, y se convierte en lo que es: una operación que aprovecha la estructura interna del Transformer para sostener tareas dentro del turno. La palabra «aprendizaje» en ICL es histórica, no descriptiva, y la propia comunidad técnica la usa con incomodidad creciente.

«Aprende de tus conversaciones». ¿Quién aprende, exactamente?

El abuso publicitario llega aquí. Cualquiera que haya leído los términos de servicio de un asistente comercial habrá visto la frase, en alguna variante. «El sistema aprende de tus interacciones para mejorar.» Suena a feedback personal, a relación que madura, a un modelo que se vuelve tu modelo con el tiempo.

Léase con cuidado lo que dice y lo que no.

La empresa aprende, el modelo no

Lo que técnicamente ocurre, en la mayoría de productos, es que la empresa guarda tus conversaciones en sus servidores y las usa para entrenar la siguiente versión del modelo, que se desplegará para todos los usuarios. Es la empresa la que aprende, en sentido literal, y el modelo aprenderá cuando se publique la siguiente versión, no antes. Tu instancia del asistente, hoy, mañana y la semana que viene, sigue siendo el mismo modelo estático con los mismos pesos. Lo que cambia entre sesiones es el sistema que envuelve al modelo, el almacenamiento de tu perfil, la lista de hechos que un proceso ha decidido guardar. No el modelo.

La diferencia entre «mi asistente aprende conmigo» y «la empresa entrena su próximo modelo con mis conversaciones» es la diferencia entre un tutor personal y un investigador anónimo que toma notas de todo lo que dices. La primera lectura es la que el marketing fomenta. La segunda es la que está pasando.

Y conviene decirlo así sin enredarse. No porque sea escandaloso entrenar la siguiente versión con datos de usuarios — los términos lo indican, normalmente, y los usuarios pueden activar o desactivar la opción según el proveedor. Sino porque vender una cosa con la metáfora de la otra es una distorsión que afecta a las decisiones de uso, de privacidad, de delegación.

El olvido catastrófico, una grieta vieja que no se ha cerrado

Para no dar la sensación de que la dificultad de aprender es exclusiva de los LLM contemporáneos, conviene mencionar un viejo problema que el deep learning arrastra desde sus inicios y que ningún avance reciente ha resuelto del todo. Se llama catastrophic forgetting, olvido catastrófico. Cuando una red neuronal entrenada para hacer una tarea es reentrenada para hacer otra, suele degradar dramáticamente su rendimiento en la primera, incluso cuando la segunda no tiene nada que ver. La revisión más completa hasta hoy es Wang y otros en A Comprehensive Survey of Forgetting in Deep Learning (arXiv 2307.09218, varias versiones hasta 2024), complementada por Lesort y otros en Continual Learning and Catastrophic Forgetting (arXiv 2403.05175, 2024).

La consecuencia operativa importa. Aunque alguien construyera un sistema que verdaderamente aprendiera de cada usuario, modificando pesos en tiempo real, ese sistema correría el riesgo de borrar conocimiento previo para acomodar el nuevo. El continual learning es un campo abierto desde hace décadas, con avances parciales y sin ningún algoritmo que haya resuelto la cuestión en general. Y mientras el campo no esté resuelto, la promesa comercial de «un modelo que aprende contigo» o bien se sostiene sobre fine-tuning periódico controlado por el proveedor, o bien se sostiene sobre indexación externa, o bien se sostiene sobre nada.

Delegar a algo que no aprende

Si el sistema no aprende en el sentido humano del verbo, y nosotros operamos con él como si aprendiera, estamos haciendo asunciones falsas para tomar decisiones que sí cuentan.

Es lo que ocurre cuando alguien delega en un asistente comercial el seguimiento de un proyecto a varios meses, dando por hecho que el sistema irá integrando lo que va sabiendo de su trabajo. Lo que ocurre técnicamente es que el sistema, en cada sesión, recibe un dossier sintético hecho por procesos heurísticos cuya lógica el usuario no ve. Las correcciones que el usuario hace una y otra vez no se «aprenden»: se anotan, si el sistema decide que valen la pena, y se reinyectan, si el sistema decide que aplican. La diferencia con un colaborador humano que recuerda no es de grado, es de naturaleza.

Lo mismo vale para usos institucionales más serios. Cuando una administración pública adopta un sistema basado en LLM para tramitación o asesoramiento, y el discurso público da por hecho que el sistema «mejora con el uso», está dando por hecho una cosa que técnicamente no ocurre en la instancia desplegada. El sistema desplegado no aprende. La empresa proveedora sí, en su laboratorio, y con plazos y procesos propios. Esa diferencia es enorme cuando se trata de auditar quién mejora qué con qué datos.

Bender, Gebru, McMillan-Major y Shmitchell, en Stochastic Parrots (FAccT 2021), apuntaban a esto con un lenguaje que ya entonces sonaba duro y que la realidad posterior ha refinado más que desmentido. Lo que se vende como aprendizaje suele ser repetición sofisticada con ajuste contextual. No es lo mismo. Y la pregunta no es si la diferencia es relevante para un usuario casual que pide recetas de pasta: no lo es. La pregunta es si la diferencia es relevante para alguien que delega trabajo serio en un sistema y luego firma con su nombre lo que sale.

Definiciones

Aprendizaje. En su definición operativa mínima, proceso que produce un cambio persistente en la respuesta de un sistema, transferible a situaciones parecidas y estable en el tiempo. Sin persistencia, no hay aprendizaje en sentido estricto.

Fine-tuning. Reentrenamiento de un modelo preentrenado sobre un corpus específico, modificando sus pesos. La versión resultante es un modelo distinto del original. Es el procedimiento de un LLM que más se parece a aprender, aunque no es continuo ni personal.

In-context learning (ICL). Capacidad de un LLM para resolver una tarea a partir de ejemplos dados en el prompt, sin modificación de pesos. Funciona dentro del turno y desaparece al cerrar la sesión. Técnicamente es pattern matching, no aprendizaje.

RAG (retrieval-augmented generation). Sistema que indexa texto externo y lo inyecta en la ventana del modelo cuando es relevante para la consulta. No modifica el modelo; complementa el contexto.

Induction head. Cabeza de atención dentro de un Transformer especializada en reconocer y continuar patrones repetidos en el contexto. Olsson y otros la propusieron como mecanismo principal subyacente al in-context learning.

Catastrophic forgetting. Fenómeno por el que una red neuronal entrenada para una tarea pierde rendimiento en ella al ser entrenada para una nueva. Es la grieta principal que el campo del aprendizaje continuo intenta cerrar, sin éxito todavía.

Continual learning. Subcampo del machine learning que estudia cómo entrenar modelos para que adquieran nuevas capacidades sin degradar las anteriores. Abierto desde los años ochenta, con avances parciales y ninguna solución general.

Referencias

Tulving, E. (1972). Episodic and Semantic Memory. En Organization of Memory, Academic Press. Marco operativo de la persistencia como condición del aprendizaje, citado para fijar la definición frente a la metáfora comercial.

Brown, T. et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020. arXiv 2005.14165. Paper que populariza el término «in-context learning» al presentar GPT-3.

Min, S. et al. (2022). Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?. EMNLP 2022. arXiv 2202.12837. Evidencia empírica de que las etiquetas correctas en los ejemplos del prompt apenas afectan al rendimiento de ICL.

Olsson, C. et al. (2022). In-context Learning and Induction Heads. Anthropic Research / arXiv 2209.11895. Identifica las induction heads como mecanismo subyacente al ICL, presentándolo como pattern matching y no como aprendizaje conceptual.

Wang, L. et al. (2024). A Comprehensive Survey of Forgetting in Deep Learning. arXiv 2307.09218. Revisión exhaustiva del estado del olvido catastrófico en redes neuronales.

Lesort, T. et al. (2024). Continual Learning and Catastrophic Forgetting. arXiv 2403.05175. Panorama del aprendizaje continuo, citado para mostrar que la grieta sigue sin cerrarse.

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Crítica de fondo al uso de vocabulario cognitivo para describir lo que hacen los LLM.

Marcus, G. (2019). Rebooting AI. Pantheon. Crítica anticipada al uso de la palabra «aprendizaje» aplicado a sistemas sin modificación persistente.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario