El problema del contexto. La jaula invisible de toda conversación humano-IA

En este artículo

  1. La ventana no es una decisión comercial
  2. Los intentos de romper el muro
  3. De la atención a los espacios de estados
  4. Lost in the middle. Lo que pasa dentro de la ventana
  5. El borrado sin aviso
  6. Cuando el modelo se vuelve raro
  7. La «comprensión» que se vende y la que cabe
  8. Una jaula que se ensancha no es un campo abierto

Definiciones · Referencias · También te interesa · En otros sitios

La arquitectura Transformer, formalizada por Vaswani y otros en 2017, opera bajo una ventana de atención finita. Lo que cabe en la ventana, existe para el modelo. Lo que queda fuera, para el modelo no existió. En 2026 los grandes laboratorios han escalado la ventana a uno o dos millones de tokens, y el marketing lo presenta como si el problema estuviera resuelto. No lo está. Es más grande la jaula, no ha dejado de ser jaula. Cualquier conversación seria con una IA se libra dentro de esos bordes, y la «comprensión» que se promete viene atada al marco, no más allá.

La ventana no es una decisión comercial

Hay una confusión cómoda que conviene cortar al principio. La ventana de contexto de un LLM no es un cinturón de seguridad que el proveedor te haya puesto para no abusar del servicio. Es una propiedad de la arquitectura. El Transformer, descrito en Attention Is All You Need (Vaswani et al., NeurIPS 2017), procesa una secuencia de tokens calculando para cada uno cuánto atiende a cada uno de los demás. Si tu entrada tiene mil tokens, el modelo construye internamente una matriz de atención de mil por mil. La operación está en el corazón del mecanismo. Sin esa matriz, el Transformer no es un Transformer.

Cuando duplicas la longitud de la entrada, la matriz no se duplica: se cuadruplica. Diez mil tokens significan cien millones de entradas en la matriz. Cien mil tokens significan diez mil millones. Un millón de tokens significan un billón. La operación de calcular toda esa atención no escala linealmente, escala cuadráticamente, y el coste se paga dos veces: en memoria, porque la matriz hay que guardarla; y en compute, porque cada entrada hay que calcularla. Por eso ampliar la ventana del modelo cuesta caro, y cada salto de un orden de magnitud requiere o bien trucos arquitectónicos o bien una factura energética notable que alguien acaba pagando.

La ventana, entonces, no es una elección de producto. Es un compromiso entre lo que la arquitectura puede sostener, lo que el GPU del momento permite, y lo que el cliente está dispuesto a pagar por consulta. Dentro de ese compromiso, los laboratorios ajustan el dial. Pero el dial vive dentro de un rango impuesto por el silicio y por las matemáticas, no por la voluntad de ser generosos.

Los intentos de romper el muro

La industria académica lleva ocho años empujando contra esta restricción, y conviene saber qué se ha conseguido y qué no.

Longformer, propuesto por Beltagy, Peters y Cohan en 2020, fue uno de los primeros intentos serios. La idea es sustituir la atención completa por una atención dispersa: cada token presta atención solo a una ventana local de tokens cercanos, más unos pocos tokens «globales» elegidos a mano para sostener la coherencia de largo alcance. El coste se vuelve lineal. La ventana sube a decenas de miles. El precio que se paga es que la representación del texto pierde finura: no todos los tokens están conectados con todos, así que ciertas relaciones a distancia se rompen. Es una técnica que funciona razonablemente bien en documentos largos donde la mayoría de las conexiones relevantes son locales, y no tan bien en tareas que requieren atar un detalle del principio con uno del final.

De la atención a los espacios de estados

Mamba, presentado por Gu y Dao en arXiv 2312.00752 en 2023, es un salto más profundo. Renuncia al mecanismo de atención y vuelve a un linaje antiguo, el de los modelos de espacio de estados (SSM, state space models), modernizado con una pieza llamada selective scan que permite que el estado se actualice de forma dependiente del contenido. La complejidad es lineal en la longitud de la secuencia. En benchmarks de lenguaje compite con Transformers comparables. Funciona, y bien. Pero todavía no se ha probado a la escala bruta a la que se han escalado los Transformers comerciales, ni con la inversión en post-training que estos llevan acumulada. Es una arquitectura prometedora, no un sustituto desplegado.

RWKV (Peng et al., 2023), híbrido entre red recurrente y atención, juega un papel parecido. Coste lineal en inferencia, ventana teóricamente infinita, comunidad activa, modelos abiertos de tamaños modestos. Y la misma limitación práctica: las cifras de rendimiento más altas del estado del arte, las que llenan kits de prensa y rankings, las sigue sosteniendo el Transformer clásico con su ventana cuadrática y su factura.

Lo que se concluye honestamente de este panorama es lo siguiente. El muro del coste cuadrático tiene grietas técnicas reales. Las grietas todavía no se han traducido en productos de masa que igualen a los Transformers en todo. Y mientras eso no ocurra, el negocio se libra dentro del marco cuadrático y, por tanto, dentro de una ventana que crece, pero no tanto como el marketing pretende.

Lost in the middle. Lo que pasa dentro de la ventana

Hay un resultado experimental que conviene meter en la pared al lado de la cifra de los dos millones de tokens. En 2023 Nelson Liu y otros publicaron Lost in the Middle: How Language Models Use Long Contexts, aparecido posteriormente en TACL 2024. El experimento es modesto y por eso es brutal. Toman varios modelos comerciales con ventanas largas, les meten un documento dentro del que esconden la pieza de información necesaria para responder a una pregunta, y van moviendo esa pieza de sitio dentro del contexto: principio, medio, final.

El gráfico de rendimiento tiene forma de U. Cuando la información clave está al principio o al final del contexto, el modelo la encuentra con razonable precisión. Cuando está enterrada en el medio, el rendimiento se desploma. En algunos modelos la caída es de decenas de puntos porcentuales. Es decir, el modelo «tiene» la información dentro de su ventana, técnicamente la está procesando, y aun así la pierde.

Esto importa mucho. Significa que la ventana de contexto no es ni siquiera un contenedor uniforme: dentro tiene zonas privilegiadas y zonas ciegas. La promesa publicitaria de que un modelo «puede leer dos millones de tokens» se traduce, en la práctica, en que puede leer bien los primeros cincuenta mil y los últimos cincuenta mil, y a partir de ahí su atención está sirviendo café. Liu y otros lo midieron. La industria, en general, no lo cita en los keynotes.

El borrado sin aviso

Hay una segunda propiedad de la ventana que el usuario casi nunca conoce explícitamente y que cambia la lectura de cualquier conversación larga. Cuando se desborda, el modelo no avisa.

Si tu conversación con un asistente comercial supera el tamaño de la ventana, la mayoría de los sistemas hace una de tres cosas. O bien recorta los mensajes más antiguos de raíz, sin tocar nada en el frontal del chat. O bien los resume con otro proceso y mete el resumen donde antes estaba el original. O bien los reemplaza por un placeholder genérico. En cualquiera de los tres casos, lo que el usuario ve en su pantalla es la conversación entera, intacta, como si todo siguiera estando dentro de la cabeza del modelo. Lo que el modelo realmente ve es otra cosa.

Es una asimetría informativa importante, y no es accidental. Avisar al usuario de que «en este turno he olvidado lo que dijiste en los primeros cuarenta mensajes» rompería el efecto de continuidad sobre el que descansa el producto. Mantener el aviso oculto preserva la ilusión de que el asistente sigue contigo, cuando en realidad lleva tres turnos siendo un asistente distinto al que arrancó la sesión.

Cuando el modelo se vuelve raro

Esto tiene consecuencias prácticas. Cualquiera que haya usado un LLM para sostener una tarea compleja a lo largo de muchos mensajes, ha tropezado con el momento en que el modelo «se vuelve raro»: contradice algo que él mismo afirmó al principio, olvida una restricción que se le había impuesto, inventa una conclusión incompatible con los datos que se le habían dado. La explicación intuitiva del usuario es que el modelo ha cometido un error. La explicación correcta, la mayoría de las veces, es que la parte de la conversación donde estaba esa información ya no está en la ventana, y el modelo está improvisando a partir de lo que queda.

Cuando alguien defiende que los LLM «mantienen el contexto bien», suele estar describiendo conversaciones cortas dentro de la zona de comodidad de la ventana. La afirmación deja de ser cierta a partir de cierto umbral, y el umbral no está señalado en ningún sitio visible para el usuario.

La «comprensión» que se vende y la que cabe

Hay un argumento más filosófico al que conviene asomarse aunque sea brevemente. Emily Bender y Alexander Koller, en Climbing towards NLU (ACL 2020), sostuvieron que un sistema entrenado solo sobre forma lingüística, sin acceso al referente externo de lo que se dice, no está comprendiendo en el sentido fuerte del término. Su argumento, el del «pulpo» que aprende inglés escuchando llamadas de teléfono pero sin tocar nunca un coco, está pensado para los LLM con o sin ventana larga.

La ventana añade a esa discusión un matiz operativo, no filosófico. Aunque uno acepte por convención llamar «comprensión» a lo que hacen los LLM, esa comprensión está atada a lo que se le ha metido en la ventana en este turno. Si el documento de contexto cabe, hay comprensión. Si no cabe, no la hay. Y si cabe pero está en la zona media, hay comprensión a medias, con la forma de U que Liu y otros midieron.

Lo que se promete cuando se dice que un modelo «entiende un libro entero» es algo más fuerte. Es la sugerencia de que ha integrado el libro en una representación estable que perdura más allá del turno, que pondera unas secciones contra otras, que sostiene una jerarquía de qué fue importante y qué fue accesorio. Nada de eso pasa. Lo que pasa es que el libro cabe en la ventana, el modelo lee, el modelo contesta, y al cerrar la sesión la representación del libro deja de existir. Hablar de comprensión cuando se describe ese flujo es elástico en el mejor de los casos, deshonesto en el peor.

Marcus, en Rebooting AI (Pantheon, 2019), llevaba unos cuantos años insistiendo en esto cuando los Transformers todavía trabajaban con ventanas de dos mil tokens. La ventana ha crecido tres órdenes de magnitud. El argumento no ha envejecido casi nada.

Una jaula que se ensancha no es un campo abierto

La trampa retórica habitual consiste en presentar cada salto de ventana como un avance hacia la disolución del problema. Ocho mil, treinta y dos mil, cien mil, ciento veintiocho mil, doscientos mil, un millón, dos millones. La línea va subiendo, y el argumento publicitario es que en algún momento la ventana será lo bastante grande para que el problema deje de serlo en términos prácticos.

Lo que oculta esa lectura es la naturaleza del problema. La ventana no es solo una cantidad. Es una frontera. Mientras haya frontera hay un afuera, hay un borrado silencioso al cruzarla, hay un peso desigual de la atención dentro, hay una dependencia de qué porción del mundo se elige meter en cada turno. Una jaula de dos millones de tokens es más grande que una de ocho mil, pero sigue siendo jaula, y todas las conversaciones humano-IA siguen librándose dentro de ella.

Lo honesto sería decirlo así desde el principio, y operar en consecuencia. Que la conversación con una IA es un duelo dentro de un marco que el modelo no escogió y el usuario no ve. Que el marco se mueve, pero no desaparece. Y que cualquier promesa de comprensión a largo plazo, de continuidad real entre sesiones, de pensamiento sostenido más allá del turno, está vendiendo algo que la arquitectura, por ahora, no permite hacer.

Definiciones

Token. Unidad mínima de texto que el modelo procesa. En inglés equivale aproximadamente a media palabra. En español, dependiendo del tokenizador, suele ser algo menor.

Ventana de contexto. Cantidad máxima de tokens que un modelo puede tener delante simultáneamente en una inferencia. Determina cuánto texto puede leer y mantener activo a la vez. Todo lo que excede la ventana queda fuera del alcance del modelo en ese turno.

Transformer. Arquitectura de red neuronal descrita por Vaswani et al. en 2017, basada en el mecanismo de atención. Domina hoy el campo de los modelos de lenguaje y es la arquitectura que sostiene a GPT, Claude, Gemini y la mayoría de modelos abiertos.

Atención. Operación por la que cada token de la secuencia calcula cuánto debe «mirar» a cada uno de los demás para construir su representación. La atención completa tiene coste cuadrático en la longitud de la secuencia.

Atención dispersa. Variantes que no calculan toda la matriz de atención sino solo una parte: vecinos locales, tokens globales, patrones predefinidos. Reducen el coste a casi lineal a cambio de perder cobertura. Longformer es el ejemplo clásico.

State space model (SSM). Familia de arquitecturas alternativas al Transformer, que procesan la secuencia manteniendo un estado interno que se actualiza paso a paso. Coste lineal en la longitud. Mamba es el representante moderno.

Lost in the middle. Resultado experimental que muestra que los LLM con ventanas largas atienden mucho mejor a los extremos de su contexto (principio y final) que al centro. El rendimiento en función de la posición de la información clave tiene forma de U.

Cuadrático / lineal. Términos que describen cómo crece el coste de una operación al crecer la entrada. Cuadrático: si la entrada se duplica, el coste se cuadruplica. Lineal: si la entrada se duplica, el coste se duplica.

Referencias

Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS 2017. arXiv 1706.03762. Origen de la arquitectura Transformer y del mecanismo de atención sobre el que descansan los LLM contemporáneos.

Beltagy, I., Peters, M. E. & Cohan, A. (2020). Longformer: The Long-Document Transformer. arXiv 2004.05150. Atención dispersa con coste lineal, citada como el primer intento serio de romper la barrera cuadrática.

Gu, A. & Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv 2312.00752. Arquitectura alternativa basada en modelos de espacio de estados, citada como sustituto candidato del Transformer.

Peng, B. et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv 2305.13048. Híbrido entre red recurrente y atención, citado como otra línea con coste lineal en inferencia.

Liu, N. F. et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics, 12, 157–173. arXiv 2307.03172 (2023). Fuente de los datos sobre el rendimiento en forma de U dentro de la ventana.

Bender, E. & Koller, A. (2020). Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data. ACL 2020. Argumento conceptual sobre los límites de la comprensión en sistemas entrenados solo con forma lingüística.

Marcus, G. (2019). Rebooting AI: Building Artificial Intelligence We Can Trust. Pantheon. Crítica anticipada al uso del término «comprensión» aplicado a modelos sin representación estable más allá del turno.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario