El problema de entrenar con el pasado. La historia es básicamente cambio discontinuo

En este artículo

  1. La asunción que ninguna app comercial menciona
  2. Cisnes negros, sin literatura barata
  3. La fecha de corte y la trampa que esconde
  4. Cuándo falla espectacularmente la extrapolación lineal
  5. La aplicación comercial como retrovisor caro
  6. Lo que esta limitación obliga a hacer

Definiciones · Referencias · También te interesa · En otros sitios

Todo modelo se entrena con datos del pasado. Pretender que extrapole al futuro es pedirle que haga lo que ningún humano sabe hacer y que ninguna ciencia ha conseguido todavía. Nassim Taleb dedicó El cisne negro en 2007 a documentar la ceguera estadística ante rupturas. Los grandes cambios históricos son, por definición, no extrapolables desde lo previo: si se pudieran extrapolar, no serían los grandes cambios. La IA predice tendencias proyectando lo que ya hubo, no anticipando rupturas. Para todo cambio discontinuo, está ciega. Y la historia es básicamente cambio discontinuo.

La asunción que ninguna app comercial menciona

El aprendizaje supervisado descansa sobre una asunción que casi nunca se enuncia en voz alta porque, dicha en voz alta, asusta. La asunción es que el futuro se parecerá lo suficiente al pasado como para que un modelo entrenado con ejemplos del pasado siga siendo útil sobre instancias futuras. En términos técnicos, se asume que los datos de test serán independientes e idénticamente distribuidos respecto a los datos de entrenamiento, o como mínimo lo suficientemente parecidos para que las relaciones aprendidas se mantengan.

En entornos cerrados, la asunción se cumple razonablemente. La distribución del ajedrez no cambia con los años. La distribución de los píxeles de una radiografía de tórax tampoco, dentro de los márgenes de variación del aparato. Las patentes de un campo técnico maduro siguen patrones lo bastante estables para que un modelo entrenado en 2020 funcione en 2024.

En entornos abiertos, la asunción se rompe con una facilidad que el discurso comercial elide. La distribución del comportamiento del consumidor cambia con cada crisis económica. La distribución de las amenazas geopolíticas cambia con cada guerra. La distribución del lenguaje cambia con cada moda. La distribución del propio uso de la IA cambia con cada modelo nuevo lanzado al mercado. Cuando la distribución cambia, la maquinaria estadística que aprendió la anterior no traduce automáticamente. Predice como si la distribución siguiera siendo la que conoce, y se equivoca con la fluidez característica del LLM que no avisa de que está fuera de distribución.

Cisnes negros, sin literatura barata

El argumento clásico contra la extrapolación lo planteó Nassim Taleb en The Black Swan. The Impact of the Highly Improbable (Random House, 2007) y, con otros instrumentos, en Antifragile (Random House, 2012). Conviene saltarse la parte popular del personaje y quedarse con la observación dura. Hay una clase de eventos, los que él llamó cisnes negros, que cumplen tres propiedades. Primera: están fuera de las expectativas razonables previas, es decir, ningún modelo entrenado sobre los datos disponibles antes del evento podía predecirlo. Segunda: tienen impacto extremo, mueven sistemas enteros. Tercera: a posteriori se vuelven explicables, y la narrativa hace olvidar que eran imprevisibles antes.

Los ejemplos que llenan los libros de finanzas y de historia son los de manual. La caída de la URSS en 1991. El ataque del 11 de septiembre. La crisis financiera de 2008. La pandemia de 2020. La invasión rusa de Ucrania en 2022. Cada uno cumple las tres propiedades de Taleb. Cada uno fue precedido por análisis expertos que decían que no iba a ocurrir. Cada uno generó, después, una literatura abundante que explicaba por qué era inevitable.

La pregunta interesante para la IA no es si los humanos somos malos prediciendo cisnes negros. La respuesta empírica, documentada por Philip Tetlock en Superforecasting (Crown, 2015), es que somos malísimos, con margen para mejorar pero sin posibilidad de cerrarlo. La pregunta es si una IA entrenada con todos los textos que documentan los cisnes negros pasados estaría en mejor posición para anticipar los siguientes. La respuesta, por construcción, es no. Los cisnes negros se definen precisamente porque no son inferibles desde lo previo. Tener más datos del pasado no ayuda. Tener datos más finos del pasado tampoco. El problema no es estadístico. Es estructural.

La fecha de corte y la trampa que esconde

Hay un detalle técnico que conviene tener presente porque atraviesa cualquier conversación con un LLM y casi nadie lo verbaliza. Cada modelo tiene una fecha de corte de conocimiento, knowledge cutoff. Es el momento hasta el que se incluyeron datos en el corpus de entrenamiento. GPT-4 originalmente tenía cutoff en septiembre de 2021. Modelos más recientes lo tienen en distintas fechas según versión y proveedor, normalmente entre uno y dos años antes del despliegue público.

Lo que el usuario rara vez nota es que el modelo no anuncia esa fecha en cada respuesta. Habla en presente sobre un mundo que, en muchos detalles, ya cambió. Te informa sobre quién dirige una empresa, qué normativa aplica, qué cifra macro tuvo un país, con la fluidez de quien lee el periódico, y resulta que su periódico se quedó en una fecha concreta que el usuario debería tener apuntada y casi nunca tiene.

Esta es la trampa más doméstica del problema general de entrenar con el pasado. No es solo que la IA no anticipe rupturas. Es que no sabe qué rupturas ya han ocurrido después de su corte. Una empresa puede haber quebrado, un partido haber ganado una elección, una guerra haber estallado, una innovación haber cambiado un sector entero, y el modelo seguirá hablando como si la situación previa al corte siguiera vigente. La cobertura por RAG, cuando existe y se invoca, mitiga parte del problema: el sistema busca información actualizada y la inyecta. Pero la cobertura por RAG no es universal, depende de la calidad de la búsqueda, y muchas conversaciones cotidianas se desarrollan sin invocarla. El usuario asume que el modelo «sabe lo que está pasando» y el modelo está respondiendo desde su congelación temporal sin avisar.

Lazaridou y otros, en Mind the Gap. Assessing Temporal Generalization in Neural Language Models (NeurIPS 2021, arXiv 2102.01951), documentaron empíricamente la degradación. Cuando un modelo tipo Transformer-XL se evalúa sobre texto posterior a su periodo de entrenamiento, su perplejidad sube de manera consistente, y escalar el tamaño del modelo no resuelve el problema. La capacidad bruta no cubre el cambio de distribución. Dhingra y otros, en Time-Aware Language Models as Temporal Knowledge Bases (TACL 2022, arXiv 2106.15110), llegaron a denominar este fenómeno temporal misalignment y propusieron modelar el timestamp junto con el texto para amortiguarlo. La propuesta es razonable y la mayoría de modelos comerciales todavía no la implementa.

Cuándo falla espectacularmente la extrapolación lineal

Hay un ejercicio mental que conviene hacer antes de delegar predicciones en un LLM. Pensar cuáles de los grandes cambios recientes habrían sido predecibles desde la pendiente anterior.

La caída de Lehman Brothers en septiembre de 2008 era extrapolable desde los seis meses previos si uno sabía leer los CDS, no era extrapolable desde los cinco años previos. La pandemia de COVID-19 en febrero de 2020 era extrapolable desde el brote de Wuhan, no era extrapolable desde el conjunto de pandemias conocidas en términos del impacto que tuvo en logística global y mercados financieros. La explosión de los LLM comerciales desde finales de 2022 era extrapolable, si acaso, desde el círculo cerrado de quienes seguían arxiv en 2021; era invisible para el resto del sector tech.

En los tres casos, la regularidad estadística aprendida sobre el pasado habría predicho continuidad. Lo que ocurrió fue ruptura. Un modelo entrenado sobre todos los datos previos a cada uno de esos eventos habría producido predicciones plausibles, fluidas y completamente erradas. Y esto no es defecto del modelo. Es propiedad del aparato. Cualquier sistema basado en aprender regularidades estadísticas pierde tracción cuando la realidad deja de comportarse como antes.

Lo incómodo de la pregunta es lo siguiente: ¿es la historia básicamente continuidad puntuada por rupturas raras, o es básicamente ruptura encubierta por continuidad aparente? La pregunta tiene respuestas distintas según el horizonte temporal. A escala humana corta, el día tras día se parece al anterior. A escala humana media, la década se parece poco a la anterior y mucho a la siguiente. A escala humana larga, los cambios son enormes y la extrapolación lineal es ridícula. Los LLM son, por construcción, herramientas de la primera escala. Los usamos con frecuencia para preguntas de la segunda y la tercera.

La aplicación comercial como retrovisor caro

Aquí aparece la tensión operativa que vale la pena nombrar. Buena parte de los productos comerciales basados en IA se venden con un lenguaje de predicción: predicción de demanda, predicción de churn, predicción de fraude, predicción de éxito de un producto. La palabra «predicción» evoca capacidad de anticipar el futuro. Lo que el sistema hace es, en realidad, detectar regularidades del pasado y proyectarlas hacia adelante con el supuesto, no anunciado al cliente, de que el futuro se parecerá al pasado lo suficiente.

Mientras el supuesto se cumple, el sistema parece predecir. Es retrospectiva camuflada de prospectiva, y la diferencia no se nota porque las dos producen output similar cuando no hay ruptura. La diferencia se nota cuando hay ruptura, y entonces es demasiado tarde para el negocio que confiaba en el sistema, porque la decisión basada en la predicción ya se ha tomado.

Esto da una manera práctica de leer la promesa publicitaria. Si la empresa proveedora vende su sistema como «modelo predictivo», conviene preguntarle qué hizo el sistema en marzo de 2020, en septiembre de 2008, en el febrero de 2022. Si la respuesta es que el sistema acertó, hay que sospechar overfitting retroactivo. Si la respuesta es que el sistema falló y se recalibró después, es la respuesta honesta: lo que vende es un modelo que sigue tendencias, no anticipa rupturas. Si la respuesta es que el sistema no estaba operativo entonces y por tanto no aplica, la pregunta queda abierta sobre qué hará con la próxima ruptura.

Una IA usada como sistema de predicción es un retrovisor caro. Sirve para entender lo que ya pasó, hace patrones legibles donde antes había ruido, ayuda a contar la historia coherente del trecho recorrido. No anticipa lo que viene. Y casi todas sus aplicaciones empresariales se venden como lo segundo, porque lo primero no tiene gancho comercial.

Lo que esta limitación obliga a hacer

Aceptar el problema no obliga a desechar las herramientas. Obliga a usarlas en el rango donde son útiles. Una IA bien usada en una empresa es la que se aplica a tareas dentro de distribución estable: control de calidad, clasificación de documentos rutinarios, asistencia a tareas repetitivas. La misma IA mal usada es la que se aplica a decisiones estratégicas que requieren anticipar cambios de régimen, no continuidad.

Taleb proponía una salida más radical, la del antifrágil. En lugar de intentar predecir cisnes negros, construir sistemas que sean más fuertes con cada golpe, no más débiles. Es una propuesta interesante para diseño organizacional y para gestión de carteras financieras. Es una propuesta extraña aplicada al despliegue de IA, porque los sistemas basados en aprendizaje son por arquitectura frágiles ante cambios de distribución. Mejorarlos requiere o bien actualizarlos continuamente, lo cual tiene su propio coste y sus propios sesgos, o bien aceptar su uso restringido a dominios estables.

Bender y otros, en Stochastic Parrots (FAccT 2021), avisaban entre otras cosas de esta limitación. Un sistema que produce texto plausible sobre el futuro habla con la misma fluidez que sobre el pasado, y el usuario carece de marcadores para distinguir un caso del otro. La fluidez es uniforme; la fiabilidad es disímil. Y mientras los productos comerciales no ofrezcan al usuario, en cada respuesta, una declaración explícita sobre si la pregunta cae dentro o fuera de su distribución de entrenamiento, el usuario seguirá tomando decisiones sobre el futuro con un retrovisor que el vendedor le presentó como parabrisas.

Definiciones

Aprendizaje supervisado. Paradigma en el que un modelo aprende a predecir salidas a partir de pares de entrada-salida en un conjunto de entrenamiento. Asume que los datos de uso se distribuirán de manera parecida a los de entrenamiento.

Datos i.i.d. (independent and identically distributed). Asunción técnica de que los datos de entrenamiento y los de uso son independientes entre sí y siguen la misma distribución estadística. La violación de la asunción es la causa principal del fallo en producción.

Cisne negro. Concepto de Nassim Taleb para eventos que cumplen tres propiedades: están fuera de las expectativas razonables previas, tienen impacto extremo, y se explican retrospectivamente como si hubieran sido predecibles.

Knowledge cutoff. Fecha hasta la que se han incluido datos en el corpus de entrenamiento de un modelo. Después de esa fecha, el modelo no tiene información directa salvo que el sistema que lo envuelve le inyecte contenido fresco.

Temporal misalignment. Fenómeno por el que un modelo entrenado hasta una fecha concreta da respuestas que han envejecido sin que el modelo lo señale. Documentado por Dhingra y otros (2022) como propiedad estructural de los LLM.

Distribución (en ML). Patrón estadístico que siguen los datos sobre los que un modelo opera. Cuando los datos de uso «caen fuera de distribución», el rendimiento del modelo se degrada sin garantía de que el modelo lo anuncie.

Retrospectiva camuflada de prospectiva. Forma de uso de sistemas predictivos en la que se vende como anticipación lo que es proyección de regularidades pasadas. Funciona mientras no hay ruptura, falla en cuanto la hay.

Referencias

Taleb, N. N. (2007). The Black Swan. The Impact of the Highly Improbable. Random House. Marco general sobre la ceguera estadística ante rupturas y la imposibilidad de anticiparlas desde la distribución previa.

Taleb, N. N. (2012). Antifragile. Things That Gain From Disorder. Random House. Propuesta de diseño de sistemas robustos ante cisnes negros, citado como contraste a la fragilidad estructural del aprendizaje supervisado.

Tetlock, P. & Gardner, D. (2015). Superforecasting. The Art and Science of Prediction. Crown. Documentación empírica de los límites de la predicción experta humana, relevante para acotar las expectativas sobre cualquier sistema que predice.

Lazaridou, A. et al. (2021). Mind the Gap. Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021. arXiv 2102.01951. Evidencia de degradación de los modelos sobre texto posterior a su entrenamiento; escalar tamaño no resuelve el problema.

Dhingra, B. et al. (2022). Time-Aware Language Models as Temporal Knowledge Bases. TACL 2022. arXiv 2106.15110. Introduce el concepto de temporal misalignment y propone modelar el timestamp junto con el texto.

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Crítica al uso del lenguaje predictivo en sistemas que solo proyectan el pasado.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario