Epoch AI dice que los datos se agotan en 2028

En este artículo

  1. El paper, lo que dice y lo que no dice
  2. Las cuatro salidas del callejón
  3. Por qué los datos sintéticos no salvan, todavía
  4. El nuevo oro privado
  5. Qué cambia para ti, usuario que no firma nada
  6. La cuestión política

Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios

Hoy hablamos del horizonte de 2028. Epoch AI, una organización pequeña y muy seria, lleva años publicando que los datos públicos de alta calidad para entrenar grandes modelos de lenguaje se agotarán alrededor de esa fecha. La predicción ha pasado por todas las publicaciones técnicas y por ninguna prensa generalista. ¿Por qué nos importa? Porque cuando se acabe el corpus público, el modelo que tendrá ventaja será el que tenga acceso a corpus privado. Y eso convierte cada conversación tuya con un chatbot en una decisión patrimonial sin que te hayan pedido firma. Mi opinión está sesgada porque he sido descuidado con mis datos y me he arrepentido. Forma la tuya.

Llevo seis meses con Epoch AI abierto como pestaña fija. Es uno de los pocos grupos que publica predicciones falsables, con metodología pública, sobre la trayectoria del sector. La conclusión que vamos a tratar hoy se conoce como Will we run out of data? y es probablemente el trabajo más leído del grupo. Se ha citado en docenas de papers académicos. Apenas se cita en prensa hispana. Quería arreglar eso.

El paper, lo que dice y lo que no dice

El trabajo lo firman Pablo Villalobos, Jaime Sevilla, Lennart Heim, Tamay Besiroglu, Marius Hobbhahn y Anson Ho, y la versión original es de noviembre de 2022 (arXiv:2211.04325). Lo que llamamos «el paper de 2028» es en realidad una actualización publicada en 2024 en el Position track de ICML, Position: Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data. Entre la versión inicial y la actualización las cifras cambiaron, y el cambio dice mucho del problema.

La idea metodológica es sencilla. Los autores estiman, primero, cuánta cantidad de texto humano de alta calidad existe accesible en internet —descontando duplicados, spam, texto autogenerado y baja calidad—. Después estiman a qué ritmo crece esa cantidad. Después estiman a qué ritmo crece el apetito de los modelos —es decir, cuántos tokens consume cada generación—. Y proyectan el cruce.

En la versión de 2022, el cruce caía cerca de 2024 con un escenario central, y entre 2026 y 2032 con escenarios optimista y pesimista. Eso encendió las alarmas. En la actualización de 2024 los autores revisaron al alza la estimación de texto disponible —el filtrado fino de la web había mejorado y permitía aprovechar más datos de los que se contaban como utilizables—. La estimación de stock de texto de alta calidad pasó de unos 10 billones de tokens a unos 50 billones. Y, con esa revisión, el cruce se desplazó a aproximadamente 2028.

La cifra de 300 billones de tokens que a veces aparece en titulares se refiere al stock total de texto humano público disponible, incluyendo calidad baja. Los modelos frontier no usan ese conjunto entero. Usan el filtrado, mucho menor. Por eso la cifra que importa es la de los 50 billones, no la de los 300.

Hay matices a la previsión que conviene mantener en la cabeza. El primero es que «agotarse» no significa cero. Significa que el ratio entre datos consumidos por la corrida y datos nuevos producidos cada año se desequilibra hasta hacer poco rentable seguir escalando por la vía clásica. El segundo es que la predicción solo concierne a datos textuales públicos en lenguajes principales. Hay reservorios alternativos —vídeo, audio, código, ciencia, idiomas minoritarios— a los que la curva no afecta de la misma manera.

Aun con todos los matices, el resultado central es estable: si la trayectoria actual de escalado por datos brutos continúa sin cambios estructurales, en torno a 2028 deja de haber texto público de alta calidad suficiente para seguir alimentándola.

Las cuatro salidas del callejón

Cuando uno se acerca a un cuello de botella, hay cuatro caminos. Conviene verlos por separado porque cada uno define a un grupo distinto de actores en el sector.

El primero es entrenar con datos sintéticos generados por otros modelos. Atractivo en teoría —si un modelo grande puede producir texto, podemos usar ese texto para entrenar al siguiente—. Hay una literatura técnica creciente que lo defiende, especialmente para datos curados con verificación de resultado, como los que DeepSeek usó en el entrenamiento de R1. Pero la versión ingenua de esta estrategia tiene un problema documentado, al que vuelvo en la siguiente sección.

El segundo es entrenar con datos privados de calidad humana. Es decir, con texto producido por humanos pero no accesible en la web pública. Los archivos internos de las grandes editoriales. Las conversaciones de plataformas cerradas. Los chats con asistentes de IA. Los correos corporativos. La grabación de llamadas. Las redacciones académicas. Aquí es donde el sector está apostando agresivamente desde 2023. Lo vemos en los acuerdos de licencia de OpenAI con News Corp, Axel Springer, Financial Times, Le Monde y otros editores. Lo vemos en el acuerdo de Google con Reddit firmado en febrero de 2024 por una cifra anual del orden de los 60 millones de dólares según las filtraciones recogidas por Reuters. Lo vemos en Meta utilizando contenido público de Instagram y Facebook como corpus de entrenamiento desde 2024. Lo vemos en Microsoft accediendo a LinkedIn por estructura corporativa.

El tercero es expandir hacia modalidades distintas del texto. Vídeo, audio, imagen, sensores robóticos. El corpus disponible en vídeo de YouTube y en audio de podcasts es órdenes de magnitud superior al de texto, una vez digerido por modelos multimodales. Esta es una de las líneas de inversión más fuertes de Google y de OpenAI desde 2024. No resuelve el cuello de botella para tareas puramente textuales, pero abre nuevas dimensiones.

El cuarto es cambiar el paradigma de entrenamiento. Reducir la dependencia del volumen bruto y aumentar la dependencia del razonamiento. Los modelos de razonamiento extendido tipo o1 de OpenAI, R1 de DeepSeek, o las generaciones de Claude con extended thinking, demuestran que un modelo puede mejorar en tareas difíciles dedicando más cómputo a la inferencia, no más datos al entrenamiento. Esta línea está, probablemente, donde está sucediendo lo más interesante hoy.

Esas cuatro salidas no son excluyentes. Cualquier laboratorio frontier va a combinar las cuatro. Pero la combinación que cada uno haga decide, en buena parte, dónde compite. Y solo dos de las cuatro están realmente al alcance de cualquiera: las otras dos requieren tamaño y capital que muy pocos tienen.

Por qué los datos sintéticos no salvan, todavía

En julio de 2024, la revista Nature publicó un trabajo titulado AI models collapse when trained on recursively generated data, firmado por Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson y Yarin Gal (Nature 631:755-759, 2024). El paper documentó con experimentos rigurosos lo que el sector sospechaba pero no había medido. Cuando un modelo se entrena sobre el output de modelos anteriores, generación tras generación, sufre lo que los autores llamaron model collapse: pierde la cola de la distribución estadística original, se vuelve más uniforme, peor calibrado, y acaba reproduciendo solo los patrones más frecuentes.

La razón es estadística antes que filosófica. Cada generación de modelo aprende un poco mal los eventos raros del corpus original, y cuando genera texto los infraprodice. La siguiente generación, entrenada sobre ese texto generado, los ve aún menos. La tercera generación los pierde. La diversidad léxica, semántica y estilística del corpus se va comprimiendo hacia la moda. El modelo se vuelve, en término técnico, peakier —más picudo y menos amplio—.

El paper recibió réplicas legítimas. Algunos investigadores han mostrado que cuando los datos sintéticos se filtran cuidadosamente y se mezclan con datos humanos en proporciones controladas, la degradación puede mitigarse. DeepSeek y otros laboratorios chinos demuestran que es posible entrenar con corpus parcialmente sintéticos sin colapsar, siempre que el sintético esté verificado contra ground truth externo. Pero la versión ingenua del «entrenamos cada modelo con lo que generó el anterior» está cerrada.

Esto deja a los datos sintéticos como herramienta complementaria, no como sustituto. La salida fácil al cuello de botella no es salida.

El nuevo oro privado

Una vez se cierran las dos salidas baratas —datos públicos limitados y datos sintéticos no triviales—, queda como recurso de ventaja competitiva el dato privado de calidad humana. Y aquí es donde la economía del sector se vuelve incómoda de leer.

El movimiento estratégico de los grandes hyperscalers desde 2023 se entiende mejor si se mira en clave de adquisición de corpus. Microsoft adquirió LinkedIn en 2016 por 26.000 millones de dólares y mantiene el acceso preferente al stream de texto profesional que millones de profesionales escriben cada día. Google firmó con Reddit el acuerdo de 2024 que le da acceso a las conversaciones del foro generalista más relevante del mundo en lengua inglesa. Meta utiliza el contenido público de Instagram y Facebook como corpus desde 2024, y ha confirmado oficialmente este uso, generando además fricciones regulatorias en Europa. Amazon acumula datos de interacción con Alexa y de transacciones en su marketplace. Apple anunció en 2024 acuerdos para entrenamiento sobre datos de news publishers. OpenAI mantiene una serie creciente de licencias firmadas con grandes editoriales que, según los recuentos públicos de Press Gazette, suman ya compromisos plurianuales por encima de los mil millones de dólares.

Esto no es conspiración. Es estrategia visible. La pregunta operativa es: ¿de dónde sale el corpus privado de quien no es uno de estos seis o siete? La respuesta corta: del chat que tú mantienes con su modelo.

Qué cambia para ti, usuario que no firma nada

Cuando te abres una cuenta en un servicio de IA y empiezas a conversar, generas un corpus. La política de privacidad de cada servicio decide qué se hace con ese corpus. Algunos —Anthropic Claude en su API de pago, Microsoft Copilot Enterprise— prometen no usarlo para entrenamiento. Otros —la versión gratuita de muchos servicios— sí lo usan, salvo opt-out explícito que el usuario raramente activa porque está enterrado en ajustes.

Eso significa que cada vez que un usuario formula una pregunta interesante, pega un fragmento de un documento personal, redacta un mail con un asistente, o conversa sobre su vida con un chatbot, deja oro de entrenamiento para la siguiente generación del modelo. La calidad de ese oro depende del usuario. Un médico explicando un caso clínico, un abogado resumiendo un expediente, un programador depurando un sistema concreto, un escritor afinando un párrafo: cada uno aporta un tipo de dato que en el conjunto público escasea y en el privado abunda.

La consecuencia se ve a dos años vista. La empresa que recoja el corpus privado de mayor calidad humana entre 2024 y 2028 tendrá una ventaja sustancial cuando el corpus público se sature. Los modelos públicos hablarán parecido entre sí; los modelos entrenados con los chats de millones de profesionales serán los que sepan resolver problemas concretos del oficio de cada usuario.

Esto no es ni una llamada al pánico ni una invitación a abandonar los chatbots. Es una invitación a leer la política de privacidad del servicio antes de poner ahí información sensible, y a entender que el modelo que parece gratuito está cobrando en una moneda que se llama tu texto.

La cuestión política

Esto es opinión personal pero descansa sobre la economía que llevo descrita. El agotamiento previsto del corpus público en 2028 convierte los datos privados en activo estratégico nacional. Y eso pone delante de los reguladores una pregunta que apenas se está empezando a discutir: ¿quién es dueño del corpus generado por el uso ciudadano de servicios de IA?

La respuesta hoy es: el operador del servicio, salvo que la ley diga otra cosa. En Europa, el Reglamento General de Protección de Datos (RGPD) reconoce derechos individuales sobre los datos personales, pero el régimen para datos no personales generados durante la interacción con un sistema de IA es difuso, y las grandes plataformas operan en esa zona difusa. El Reglamento europeo de IA (Reglamento UE 2024/1689) cubre obligaciones de transparencia y trazabilidad, pero no zanja la cuestión patrimonial.

En Estados Unidos no hay siquiera una regulación federal análoga al RGPD, y los datos generados en chats son, por defecto, propiedad operativa de la plataforma. En China, el corpus es activo estatal y se rige por la regulación de seguridad nacional. Tres regímenes radicalmente distintos para una misma materia prima.

Lo que sostengo es que esa diferencia regulatoria va a decidir, en los próximos cinco años, dónde se acumula la materia prima del próximo ciclo de entrenamiento. Y, por extensión, dónde se concentra el capital. Europa puede acabar siendo el continente con mejor protección individual y peor capacidad de retener corpus dentro de sus fronteras. Estados Unidos puede acabar capturando el corpus global en sus plataformas. China puede acabar con un corpus nacional cerrado pero sin acceso al global. Esos tres escenarios se están dibujando ahora, y la cifra concreta que decide cuándo se llega al cuello de botella es la que Epoch viene publicando desde 2022.

La actualización más reciente del trabajo de Villalobos, Sevilla y colaboradores, Position: Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data, presentada en ICML 2024 (PMLR 235, julio de 2024), sitúa el cruce en aproximadamente 2028 bajo el escenario central, asumiendo eficiencia de entrenamiento constante. Si esa eficiencia mejora —y el caso DeepSeek sugiere que sí, ver mi 0055—, la fecha puede empujarse uno o dos años. Si la eficiencia no mejora, llega antes.

Definiciones

Corpus de entrenamiento: conjunto de datos —en este caso, texto— usado para ajustar los parámetros de un modelo de lenguaje. La calidad y diversidad del corpus determinan en buena medida la calidad del modelo resultante.

Token: unidad mínima de texto procesada por un modelo de lenguaje. En español, un token suele equivaler a unos 0,75 caracteres de media, aunque depende del tokenizador. Los 50 billones de tokens equivalen aproximadamente al texto contenido en cientos de millones de libros.

Model collapse: degradación progresiva de un modelo cuando se entrena recursivamente sobre output de modelos anteriores. La diversidad estadística del corpus original se pierde y el modelo se vuelve más uniforme y peor calibrado. Documentado en Shumailov et al., Nature 2024.

Compute-optimal training: régimen de entrenamiento que optimiza la relación entre parámetros del modelo y datos del corpus para un presupuesto de cómputo dado. Las leyes de escalado de Chinchilla (Hoffmann et al., DeepMind, 2022) son la formulación más usada.

Referencias

Pablo Villalobos, Jaime Sevilla, Lennart Heim, Tamay Besiroglu, Marius Hobbhahn, Anson Ho, Will we run out of data? Limits of LLM scaling based on human-generated data (arXiv:2211.04325, 2022; versión revisada en Position: Will We Run Out of Data?, ICML 2024). Paper original y actualización con la cifra de 2028.

Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson, Yarin Gal, AI models collapse when trained on recursively generated data (Nature 631:755-759, julio de 2024, doi:10.1038/s41586-024-07566-y). Paper de referencia sobre model collapse.

Epoch AI, Will we run out of data to train large language models? (epoch.ai, publicación de blog y actualización continua). Resumen accesible del paper y de la metodología.

Reuters, cobertura del acuerdo Reddit-Google de febrero de 2024. Fuente de la cifra de licencia anual.

Press Gazette, cobertura agregada de los acuerdos de licencia de OpenAI con editoriales (2023-2025). Cifras combinadas de compromisos plurianuales.

Hoffmann et al., Training Compute-Optimal Large Language Models (DeepMind, arXiv:2203.15556, 2022). Las leyes de escalado de Chinchilla que enmarcan el debate sobre datos vs parámetros.

Stanford HAI, Artificial Intelligence Index Report 2026 (abril de 2025). Capítulo sobre disponibilidad y uso de datos de entrenamiento.

Para profundizar

Vili Lehdonvirta, Cloud Empires (MIT Press, 2022). Por qué las plataformas que controlan el corpus de uso ciudadano están construyendo un poder que excede al de los Estados.

Daron Acemoglu & Simon Johnson, Power and Progress (PublicAffairs, 2023). Marco histórico para entender cómo se distribuye el beneficio de una tecnología cuando un recurso clave se concentra.

Ali Borji, A Note on Shumailov et al. (2024) (arXiv:2410.12954, octubre de 2024). Réplica matizada al paper de Nature; útil para no aceptar el model collapse como dogma.

Yves Citton, L'Économie de l'attention (La Découverte, 2014). Antecedente conceptual del paso de la atención al dato como mercancía dominante.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario