En este artículo
- La metáfora del médico, en serio
- Qué es la ventana de contexto y por qué no es memoria
- Cómo se finge la memoria que no hay
- La amnesia anterógrada como condición por defecto
- Clive Wearing y la consciencia de treinta segundos
- El RAG no consolida. Indexa
- El asistente con memoria, el cliente con expectativa
- ¿Una IA sin memoria sirve para algo?
- La diferencia que el marketing necesita ocultar
- La conversación honesta empieza aceptando esto
Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios
Un LLM (modelo grande de lenguaje) no recuerda lo que hablasteis ayer. Cada conversación nace virgen, sostenida solo por lo que cabe en su ventana de contexto, una franja de texto que, en los modelos de mediados de esta década, iba de los pocos miles de tokens de los modelos baratos a los dos millones que llegó a anunciar Gemini 1.5 Pro. Fuera de esa franja, para el modelo, no existe nada. Si fueras a un médico que olvida tu caso al cerrar la puerta de la consulta, dirías que no es buen médico. A la IA se lo aceptamos porque la otra opción es darnos cuenta de que es asistente con amnesia. Y eso obligaría a revisar la mitad de los productos que ya hemos integrado en nuestra vida.
La metáfora del médico, en serio
Imagina una consulta. Cuentas tus síntomas. El médico atiende, pregunta, redacta un informe brillante mientras estás delante. Cierras la puerta. Vuelves al día siguiente. El médico te recibe con la misma cortesía profesional, sin pista alguna de quién eres ni de lo que comentasteis ayer. Le explicas de nuevo el dolor, las pruebas, el contexto. Es un buen médico, dentro de cada visita. Entre visitas no eres nada.
Eso es lo que es un LLM. Y, sin embargo, lo llamamos inteligente con la misma palabra con la que llamamos inteligente al psicoterapeuta que sigue tu caso durante quince años. No es una imprecisión del lenguaje. Es una diferencia ontológica disfrazada de matiz técnico, y el matiz le interesa al que vende el producto.
Qué es la ventana de contexto y por qué no es memoria
La unidad mínima que un modelo procesa se llama token: aproximadamente medio palabra en inglés, algo menos en español. La cantidad de tokens que un modelo puede tener simultáneamente delante, leyendo y prediciendo, es su ventana de contexto. GPT-3 trabajaba con unos dos mil. GPT-4 amplió a ocho mil, después a treinta y dos mil, y GPT-4 Turbo llegó a ciento veintiocho mil. Las primeras versiones de Claude, las de 2023, se movieron entre cien mil y doscientos mil tokens, y modelos posteriores llegaron a anunciar un millón. Gemini 1.5 Pro presumió de dos millones. Cualquier cifra concreta envejece en meses, y para cuando leas esto el récord será otro; lo que importa es que la ventana crece y la estructura no cambia.
Dentro de la ventana, el modelo es capaz de operar sobre todo lo que hay. Fuera de la ventana, el modelo es ciego. No hay archivo en bruto al que pueda volver, no hay episodio anterior consolidado en ningún sitio. La conversación de ayer, si excede el tamaño de la ventana, ha desaparecido para él del mismo modo que ha desaparecido para ti la página 78 del libro que aún no has abierto. Solo que para ti existe en la realidad y se puede consultar; para el modelo no existe.
La ventana de contexto es memoria de trabajo en sentido estricto. Es lo que en un cerebro humano se parecería al búfer fonológico: lo que estás reteniendo activamente mientras procesas. No es memoria a largo plazo. Y la diferencia entre una y otra no es cuantitativa, es cualitativa: son sistemas distintos, con neuroquímicas distintas, con funciones distintas. Confundirlos lleva treinta años siendo el error pedagógico estándar de la neurociencia popular. Confundirlos en el caso de los LLM es además lucrativo.
Cómo se finge la memoria que no hay
Hay tres mecanismos que la industria empaqueta bajo la palabra «memoria», y ninguno lo es.
El primero es el buffer de conversación. El sistema que envuelve al modelo, lo que el usuario llama «el ChatGPT» pero que técnicamente es una capa sobre el modelo, guarda lo que dijiste antes y lo vuelve a meter dentro de la ventana en cada turno. Por eso parece que el chatbot recuerda lo que pediste tres mensajes atrás. No lo recuerda. Se lo están reenviando, disimulado, en cada inferencia. Cuando la conversación supera el tamaño de la ventana, los mensajes más antiguos caen por el borde como un calcetín por el desagüe. Algunos sistemas los resumen antes de tirarlos, lo cual genera una memoria por compresión que pierde detalle a cada paso. No es lo mismo recordar que tener un resumen progresivamente degradado de lo que pasó.
El segundo es RAG, retrieval-augmented generation. La técnica, formalizada por Lewis y otros en NeurIPS 2020, funciona así. Cuando haces una pregunta, un sistema externo busca en una base de datos vectorial los fragmentos de texto más parecidos a tu consulta y los pega delante de tu pregunta, dentro de la ventana, antes de pasar todo al modelo. Es indexación, no recuerdo. El modelo no «sabe» lo que hay en la base de datos. No tiene un acceso experiencial a ese pasado. Recibe en el último momento un dossier con fragmentos que un buscador ha seleccionado por similaridad coseno, y los lee como leería un PDF que le acabaras de adjuntar. La metáfora correcta no es la memoria de un médico, es el becario que le pasa al médico tu expediente justo antes de que entres por la puerta.
El tercero, más reciente, son los agentes persistentes: GPTs personalizados, Claude Projects, asistentes con «memoria de usuario». El nombre suena a otra cosa pero el mecanismo es el mismo del primer caso, refinado. El sistema extrae frases significativas de conversaciones anteriores, las almacena externamente, y las reinyecta en la ventana cuando estima que son relevantes. La selección la hace un proceso que, lógicamente, también es un modelo, con sus propios fallos. Si el sistema decide que algo no es relevante, eso queda fuera. Si decide que algo lo es y se equivoca, eso entra y desvía la respuesta. La «memoria» del asistente personalizado es una caja decisional opaca cuyas reglas el usuario no controla y normalmente desconoce.
La amnesia anterógrada como condición por defecto
Hay un nombre clínico para el cuadro que padece un LLM. Se llama amnesia anterógrada. El paciente no puede formar nuevas memorias a largo plazo después del daño cerebral, aunque conserve perfectamente las anteriores y aunque su memoria de trabajo funcione dentro de cada interacción.
El caso paradigmático en la literatura es H. M., Henry Molaison, paciente del que Scoville y Milner publicaron en 1957 el famoso Loss of recent memory after bilateral hippocampal lesions en el Journal of Neurology, Neurosurgery, and Psychiatry. A H. M. le habían extirpado bilateralmente el hipocampo para tratar una epilepsia farmacorresistente. La epilepsia mejoró. Lo que quedó fue un hombre que, durante cincuenta y cinco años, no consolidó un solo recuerdo nuevo. Mantenía conversaciones sofisticadas. Aprendía habilidades motoras, lo que demostró que la memoria procedimental usa otros circuitos. Pero al día siguiente, al investigador que llevaba décadas estudiándolo, lo saludaba como a un desconocido.
Clive Wearing y la consciencia de treinta segundos
El otro caso es Clive Wearing, músico británico que en 1985 sufrió una encefalitis herpética que destruyó su hipocampo y partes de su corteza temporal. Su esposa Deborah escribió un libro entero sobre lo que es vivir con alguien cuya ventana de consciencia dura entre siete y treinta segundos, y que pasa todos los días redescubriendo, anotando en un cuaderno «AHORA estoy despierto por primera vez», para tachar la frase y reescribirla diez minutos después al perder el rastro. El libro es duro de leer. Es lo más parecido a entender, desde fuera, lo que es operar con una memoria de trabajo desconectada de la consolidación.
Un LLM hace estructuralmente lo mismo. La diferencia es que un LLM no sufre, hasta donde sabemos. Y que el daño no es daño, es arquitectura. Pero la operación cognitiva, leída desde fuera, es la de un cerebro con hipocampo destruido al que se le va resetando el día cada vez que cruza una puerta.
Cuando alguien defiende que llamar inteligencia a esto es una hipérbole inocua, lo razonable es contestarle si llamaría inteligencia a Clive Wearing operando un sistema bancario.
El RAG no consolida. Indexa
Conviene insistir, porque la confusión es deliberadamente sostenida por el lado vendedor. Tulving en 1972 distinguió entre memoria episódica (los hechos que viviste con marca temporal y emocional, «recuerdo cuando») y memoria semántica (los hechos que sabes sin contexto autobiográfico, «París es la capital de Francia»). La memoria humana funciona porque tiene las dos, conectadas, y porque puede transferir información de una a otra mediante consolidación, que es un proceso lento, biológico, costoso en términos de sueño y de neurogénesis. Schacter, en The Seven Sins of Memory (Houghton Mifflin, 2001), describió hasta qué punto esa consolidación es además imperfecta y reconstructiva: cada vez que recuerdas, reescribes.
Lo que RAG ofrece no entra en ninguna de las dos. Es una memoria semántica externalizada de búsqueda, una pila de fragmentos a los que se accede por similaridad y que se inyectan en la ventana sin pasar por nada que se parezca a consolidación. El modelo no integra esos fragmentos en su estructura. No los pondera contra otros. No los reescribe a la luz de experiencias posteriores. Los procesa una vez, en el turno actual, y los suelta cuando se cierra la conversación. Si vuelves mañana, el sistema busca otra vez, recupera otros fragmentos, y al modelo le llegan distintos.
Llamar a esto memoria es como llamar memoria al hecho de tener acceso a Google. El acceso a Google es estupendo. No es lo que hacíamos cuando decíamos que alguien recordaba algo.
El asistente con memoria, el cliente con expectativa
La trampa publicitaria es vieja y eficaz. La industria toma una palabra del registro humano, memoria, la pega encima de un mecanismo técnico que tiene poco que ver, y deja que el usuario rellene el hueco con su propia experiencia. El usuario tiene memoria, lleva toda la vida con ella, sabe lo que es y lo que se siente al recordar. Cuando lee «el asistente recuerda lo que le has contado», asume el sentido entero del término. Y lo que ocurre técnicamente es lo descrito antes: un proceso que extrae frases, las indexa, y las reinyecta como contexto adicional cuando otro proceso lo decide.
La diferencia entre una cosa y la otra parece cuestión de matiz. No lo es. Si un psicoterapeuta humano lleva tu caso, lo que ocurre cuando vuelves es que él recuerda quién eres, con su carga emocional, con su jerarquía privada de qué fue importante y qué fue ruido, con la trama narrativa que ha ido tejiendo a lo largo de meses. Cuando vuelves a un GPT personalizado, lo que ocurre es que un proceso ha decidido qué tres o cuatro datos tuyos eran lo bastante salientes para guardarse, y te los devuelve como bullets en el system prompt. No es un matiz: son dos sistemas distintos sirviendo la misma función al precio de definir distinto la función.
Gary Marcus lleva años quejándose, con razón, del uso elástico del término. Es una de las muy pocas cosas en las que conviene darle la razón sin pelearse antes con el resto de su discurso. Bender, Gebru, McMillan-Major y Shmitchell formularon el caso general en On the Dangers of Stochastic Parrots (2021): cada vez que la industria importa vocabulario cognitivo humano para describir un mecanismo computacional, traslada gratis al producto la carga afectiva que la palabra arrastra. «Memoria» es la pieza más rentable de ese trasiego.
¿Una IA sin memoria sirve para algo?
Sí, pero solo dentro del episodio: puede resolver una consulta puntual, redactar un informe, responder bien a un examen dentro de su ventana de contexto. Lo que no puede hacer es acompañar el caso a lo largo del tiempo, porque no consolida nada de una conversación a la siguiente. Que un modelo brille en una tarea acotada no significa que pueda llevar un caso durante meses, y la mayor parte del trabajo intelectual humano serio, fuera de los exámenes, consiste precisamente en eso: acompañar el caso.
La diferencia que el marketing necesita ocultar
Hay una pregunta que la industria no quiere que se haga en voz alta. Si una inteligencia sin memoria es algo estructuralmente distinto de la inteligencia humana, ¿qué es lo que estamos midiendo cuando comparamos su rendimiento al de un experto humano en una tarea cognitiva?
La respuesta honesta es que comparamos resultados puntuales en tareas acotadas dentro de una ventana. Que el modelo brille en un examen no significa que pueda llevar un caso a lo largo de un año. Que pase un test de razonamiento moral no significa que sostenga el mismo criterio mañana. Que conteste perfectamente a una consulta médica no significa que pueda hacer seguimiento del paciente. Lo que la inteligencia sin memoria puede hacer es resolver el episodio. Lo que no puede hacer es acompañar el caso. Y la mayor parte del trabajo intelectual humano serio, fuera de los exámenes, es acompañar el caso.
Los generative agents de Park y otros (arXiv 2304.03442, 2023) son el intento académico más serio de salvar este foso. Construyen una arquitectura de memoria simulada con tres niveles: observación, reflexión, planificación. La memoria episódica se almacena como cadena de eventos puntuables, se recuperan los más relevantes por importancia, recencia y similaridad, y un proceso de reflexión periódica genera resúmenes de alto nivel que también se guardan. El resultado es impresionante en demos. Funciona en simulaciones de pueblos digitales. No funciona, todavía, fuera de esos entornos cerrados donde el coste computacional permitiría sostenerlo a escala humana real. Y, lo más importante, sigue siendo indexación de texto, no consolidación neural. Es un sustituto inteligente. No es la cosa.
Cuando Kandel ganó el Nobel de 2000 por descubrir los mecanismos moleculares de la memoria a largo plazo en la Aplysia californica, y los amplió en In Search of Memory (Norton, 2006), describía algo que ocurre por modificación de sinapsis, por síntesis de proteínas, por cambios estructurales irreversibles en las neuronas implicadas. Eso es consolidar. Eso es lo que hace que el psicoterapeuta de antes te recuerde aún. No tiene nada que ver con calcular distancias coseno entre vectores.
La conversación honesta empieza aceptando esto
Aceptar que una inteligencia sin memoria es estructuralmente distinta de la nuestra no resuelve nada. No dice si es peor, no dice si es mejor, no dice si terminará compensando con potencia bruta lo que le falta por arquitectura. Solo dice que llamarla con la misma palabra es una elección, y que la elección beneficia a alguien.
Una conversación honesta sobre lo que un LLM puede hacer y lo que no, sobre dónde delegar en él y dónde no, sobre qué sectores económicos transformará y cuáles solo erosionará dejando un agujero, no puede empezar fingiendo que el sistema recuerda. Tiene que empezar diciendo que olvida todo cada vez que cierras la puerta, y que cada interacción es una primera consulta. Eso cambia, de golpe, la lista de profesiones que el sistema puede sustituir, las que solo puede asistir, y las que descansan precisamente sobre la propiedad que el sistema no tiene.
La mayoría de los textos comerciales sobre IA que circulan hoy no han llegado a aceptar esto. Y por eso, en su mayoría, no son textos sobre IA. Son textos sobre cómo se nos parece la IA si la miramos con la luz adecuada.
Definiciones
Token. Unidad mínima de texto que un modelo de lenguaje procesa. Equivale aproximadamente a medio palabra en inglés, ligeramente menos en español. Los modelos no leen letras ni palabras: leen secuencias de tokens.
Ventana de contexto. Cantidad máxima de tokens que un modelo puede tener delante simultáneamente al generar una respuesta. Funciona como memoria de trabajo, no como memoria a largo plazo. Todo lo que excede la ventana queda fuera del alcance del modelo.
RAG (retrieval-augmented generation). Técnica que combina un modelo de lenguaje con una base de datos externa. Cuando llega una consulta, un sistema busca fragmentos relevantes en la base, los inyecta en la ventana del modelo y deja que este responda apoyado en ese material. No es memoria; es indexación con entrega justo a tiempo.
Embedding. Representación numérica de un fragmento de texto como vector en un espacio de muchas dimensiones. Permite calcular similaridad entre textos por distancia geométrica, y es la base técnica de la búsqueda que RAG ejecuta sobre la base externa.
Amnesia anterógrada. Imposibilidad de formar nuevas memorias a largo plazo después de un daño cerebral, conservando habitualmente las anteriores y la memoria de trabajo del momento. Caracteriza estructuralmente a pacientes con destrucción hipocampal y, en analogía operativa, a los LLM por defecto.
Memoria episódica. Recuerdo de hechos vividos con marca temporal y carga subjetiva. Es la memoria que permite decir «recuerdo cuando». Tulving la distinguió en 1972 de la memoria semántica.
Memoria semántica. Conocimiento de hechos sin contexto autobiográfico. Saber que París es la capital de Francia sin recordar cuándo lo aprendiste.
Consolidación. Proceso biológico por el que una memoria de trabajo se transforma en memoria a largo plazo, mediante cambios sinápticos y síntesis de proteínas. Kandel describió los mecanismos moleculares principales. Es lo que los LLM, por arquitectura, no hacen.
Agente persistente. Sistema construido encima de un LLM que almacena externamente información de usuario y la reinyecta en la ventana cuando lo considera relevante. GPTs personalizados y Claude Projects son ejemplos comerciales actuales.
Referencias
Lewis, P., Perez, E. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. Origen formal del RAG, citado para distinguir indexación de memoria.
Park, J. S. et al. (2023). Generative Agents: Interactive Simulacra of Human Behavior. arXiv 2304.03442. Arquitectura de memoria simulada en tres niveles, citada como intento académico más serio de cerrar el foso de la persistencia.
Tulving, E. (1972). Episodic and Semantic Memory. En Organization of Memory, Academic Press. Marco que distingue memoria episódica de semántica, base del argumento sobre por qué RAG no es memoria.
Schacter, D. L. (2001). The Seven Sins of Memory. Houghton Mifflin. Citado para subrayar que la consolidación humana es además reconstructiva e imperfecta, no un archivo limpio.
Scoville, W. B. & Milner, B. (1957). Loss of recent memory after bilateral hippocampal lesions. Journal of Neurology, Neurosurgery, and Psychiatry, 20, 11–21. Caso H. M., paradigma clínico de amnesia anterógrada, citado por la analogía estructural con la condición por defecto del LLM.
Wearing, D. (2005). Forever Today: A Memoir of Love and Amnesia. Doubleday. Testimonio en primera línea sobre la vida con ventana consciente de segundos, citado por su valor analógico.
Kandel, E. (2006). In Search of Memory: The Emergence of a New Science of Mind. W. W. Norton. Mecanismos moleculares de la consolidación a largo plazo, citado para precisar qué es exactamente lo que un LLM no hace.
Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Citado por la crítica general al uso elástico de términos cognitivos aplicados a modelos de lenguaje.
Google. Long context. Documentación de la API de Gemini. Fuente de la cifra de hasta dos millones de tokens de ventana de contexto en Gemini 1.5 Pro.
Marcus, G. Marcus on AI. Substack. Crítica continuada al uso del término «memoria» aplicado a buffers y a RAG.
Para profundizar
Sacks, O. (1985). The Man Who Mistook His Wife for a Hat. And Other Clinical Tales. Summit Books. Galería de casos clínicos sobre disociaciones de memoria que sostienen, desde la neurología, la idea de que «memoria» nombra muchas cosas y no una sola.
También te interesa
- Aprender sin recordar. La palabra que la industria abusa
- El problema del contexto. La jaula invisible de toda conversación humano-IA
- Tipos de memoria
- Pensar sin entender. Si funciona igual, qué pensábamos que era pensar

Comentarios0
Todavía no hay comentarios.
Deja un comentario