En este artículo
- La frase técnica que casi nadie usa
- La proporción que no se quiere mirar
- Cómo se pierde la cola, dicho sin tecnicismo
- El problema legal que se está cocinando
- La sospecha de la fluidez
- Lo que el ingeniero sabe y la empresa minimiza
- El experimento que ya está corriendo
Definiciones · Referencias · También te interesa · En otros sitios
Shumailov y otros publicaron en Nature (2024) que entrenar modelos con datos generados por modelos previos produce «model collapse»: pérdida progresiva e irreversible de la cola de la distribución original. La IA aprende de humanos. Los humanos cada vez generan más texto con IA. La IA siguiente aprende parte de IA anterior. Es un bucle que nadie planeó y que ya está en marcha. Sus consecuencias se conocerán a posteriori. Es el experimento más grande que hemos hecho sin protocolo.
La frase técnica que casi nadie usa
«Recursive training on model-generated content». La frase suena académica y por eso pasa inadvertida. Lo que describe es esto: un modelo de lenguaje aprende de un corpus. Ese corpus, hoy, contiene texto humano y texto generado por modelos anteriores, sin distinción operativa entre ambos. El siguiente modelo, en su próximo entrenamiento, recibe la mezcla. Y al destilado de esa mezcla lo llamamos «el avance del estado del arte». No es una metáfora oscura. Es la mecánica literal del sector en 2026.
Shumailov y otros lo midieron en AI models collapse when trained on recursively generated data (Nature 631, 2024). Replicaron el bucle en tres familias distintas: modelos de mezcla de gaussianas, variational autoencoders y modelos de lenguaje grandes. En todas, el resultado fue el mismo: tras varias generaciones de entrenar al modelo sucesor sobre la salida del modelo precedente, la distribución de salida se contrae. Las colas raras desaparecen primero. Lo poco frecuente — la expresión idiomática local, la palabra obsoleta, el matiz culturalmente periférico — se va antes. Lo central se queda y se vuelve más central. La diversidad estadística colapsa sobre la mediana. Llamaron a esto model collapse y subrayaron una propiedad incómoda: el daño no es estético, es irreversible. Los modelos entrenados con datos contaminados no recuperan la cola perdida ni añadiendo más datos contaminados después.
La proporción que no se quiere mirar
Aquí aparece la pregunta operativa: ¿cuánto del corpus de los modelos actuales es ya output de IA? Nadie publica la cifra. Las grandes plataformas tampoco. Pero hay indicadores indirectos que conviene tener encima de la mesa. Elazar y otros, en What's In My Big Data? (ICLR 2024), construyeron una plataforma de auditoría llamada WIMBD que analizó más de treinta y cinco terabytes de corpus de entrenamiento populares — C4, The Pile, RedPajama. Lo que encontraron no fue una proporción limpia de sintético frente a humano, porque esa proporción no se puede medir directamente una vez el contenido está mezclado. Encontraron contaminación masiva con benchmarks, alta prevalencia de contenido duplicado, contenido de baja calidad sin etiqueta de origen, e información personal identificable. La conclusión técnica no fue «el corpus está contaminado por IA en un X por ciento». Fue que no hay manera fiable de saberlo a posteriori.
El segundo indicador es de mercado. Originality.AI publica desde 2023 un seguimiento continuo de resultados de búsqueda de Google. En sus muestreos de 2025, en torno al 17–20 % de los top-20 resultados contienen contenido generado por IA. La cifra hay que tomarla con la cautela que merece una empresa que vende detectores de IA: el sesgo de incentivo está. Lo significativo no es el porcentaje exacto. Es que, sea cual sea la cifra real, ya es alta y va subiendo. Y el crawler que alimenta el siguiente corpus de entrenamiento ingiere esa mezcla sin distinción, porque no hay protocolo escalable que permita distinguir lo humano de lo sintético cuando el sintético está bien hecho.
Cómo se pierde la cola, dicho sin tecnicismo
El concepto de «cola de la distribución» tiende a sonar abstracto. Conviene un ejemplo concreto. Cuando un modelo de lenguaje se entrena con español peninsular contemporáneo, hay palabras de uso medio que aparecen miles de veces — casa, coche, trabajo — y hay palabras de uso raro que aparecen pocas veces — desbravar, otear, quincenal. Las primeras forman el cuerpo de la distribución; las segundas forman la cola. Cuando un modelo G1 genera texto a partir de su distribución aprendida, tiende a usar las primeras con frecuencia parecida a la del corpus original y las segundas con frecuencia ya algo menor, porque la generación muestrea hacia lo probable. Si después se entrena un modelo G2 con texto generado por G1, las palabras raras aparecen aún menos en el corpus de G2. Tras varias generaciones, la cola desaparece. El sucesor habla con un vocabulario más estrecho que el predecesor, y el predecesor ya hablaba con un vocabulario más estrecho que el corpus humano original.
El fenómeno escala más allá del léxico. Estructuras sintácticas raras, formulaciones culturales minoritarias, referencias geográficas o históricas localizadas, expresiones de subculturas, registros marcados — todo lo que sea poco frecuente en el corpus humano original va perdiendo peso en cada generación. Lo que queda es una mediana cultural progresivamente más homogénea, más global, más previsible. El modelo no se vuelve tonto. Se vuelve plano.
El problema legal que se está cocinando
Hay un debate en curso en la Harvard Journal of Law & Technology sobre si emerge una categoría jurídica nueva, el derecho a datos no contaminados, entendido como derecho a que existan corpus identificables de producción humana auditada antes de la era generativa, preservados por instituciones públicas, accesibles para investigación y entrenamiento de modelos que necesiten anclar su distribución a un baseline humano verificable. La propuesta no se ha consolidado y los detalles varían entre autores. El núcleo es razonable: si el bucle de entrenamiento sigue acelerándose y no quedan reservas humanas identificables, la viabilidad técnica de futuras generaciones de modelos depende de preservar artificialmente la línea base humana.
La parte interesante aquí es la inversión cultural. Hasta hace cinco años, la conversación pública sobre datos giraba en torno a la protección de la privacidad humana frente a los sistemas. Ahora empieza a girar en torno a la protección de los sistemas frente a la inundación de su propio output. El sujeto y el predicado cambiaron de lado y casi nadie lo nombró. Es el equivalente sectorial de pedir que se proteja la pureza del manantial porque la fábrica río abajo necesita agua limpia para producir el agua embotellada que vuelve al manantial.
La sospecha de la fluidez
Bender, Gebru y otras, en On the Dangers of Stochastic Parrots (FAccT 2021), avisaron antes de que la métrica de calidad dominante en LLM — la fluidez del texto generado — fuera una métrica engañosa, porque la fluidez es una propiedad del rendimiento sintáctico-léxico que un modelo entrenado en corpus masivos exhibe casi por construcción, y que no covaría con la veracidad ni con la diversidad. El argumento es relevante aquí porque, en presencia de model collapse, lo primero que se mantiene es justamente la fluidez. La cola que desaparece no es la calidad superficial. Es la riqueza de fondo.
Esto produce un efecto paradójico fácil de medir mal. El usuario lee un texto generado por la última versión del modelo, comprueba que es coherente, gramaticalmente impecable, naturalmente legible, y deduce que el modelo «ha mejorado». Esa lectura es correcta sobre el plano de superficie y completamente ciega al plano de fondo. Un modelo más estrecho puede ser más fluido. Un modelo más diverso puede ser más rugoso. La preferencia ciega por la fluidez es una preferencia ciega por el modelo colapsado.
Lo que el ingeniero sabe y la empresa minimiza
El sector técnico conoce el problema. Los laboratorios grandes han invertido en filtros que intentan detectar contenido sintético, en datasets con marcadores de procedencia humana certificada, en contratos con productores de contenido para asegurar corpus limpio. Crawford, en Atlas of AI (Yale UP, 2021), documentó ya entonces la economía oculta del trabajo de anotación que sostiene los datasets de calidad. Esa economía está creciendo. Hay startups que venden corpus humano «pre-2022» como producto de gama alta, con la misma lógica con la que los museos venden colecciones de cobre extraído antes de las pruebas atómicas de los años cuarenta, porque ese cobre es el único que no está contaminado con isótopos radiactivos de la era nuclear y por tanto sirve para fabricar detectores que necesitan baseline limpio.
La analogía no es retórica. Es funcionalmente exacta. Hay una contaminación de fondo distribuida globalmente, irreversible a corto plazo, indistinguible al ojo, que obliga a los fabricantes de instrumental de precisión a buscar reservas anteriores al evento contaminante. Los grandes laboratorios de IA están haciendo exactamente lo mismo con el corpus textual humano: identificar, encerrar y proteger reservas datadas antes de la inundación generativa, no para el bien común, sino porque sin ellas no se puede fabricar la siguiente generación de modelos con la diversidad estadística que el siguiente modelo necesita para no colapsar.
El experimento que ya está corriendo
La cuestión incómoda no es si el bucle ocurre. Ocurre. La cuestión es a qué velocidad y con qué consecuencias culturales acumuladas. Y aquí hay una observación que conviene hacer sin floritura. No existe protocolo experimental. No hay grupo control. No hay punto de retorno. No hay condiciones de parada predefinidas. No hay autoridad institucional con capacidad de detener la ingestión recursiva mientras se mide. El experimento se conduce sobre la población lingüística global, con consecuencias que se manifestarán en los hábitos cognitivos, expresivos y estéticos de la siguiente generación de usuarios.
Sería sensato, si esto fuera ciencia, exigir un IRB, una revisión ética, un plan de monitorización. No lo es. Es despliegue comercial competitivo, y la pregunta de si el plano de fondo cultural se aplana o no se hace con la velocidad de tres trimestres financieros. La pregunta llegará a las regulaciones cuando ya tenga respuesta empírica. Esa respuesta empírica se conocerá a posteriori, cuando los efectos sean visibles. Y cuando lo sean, ya estarán incorporados al corpus mismo desde el que se podría reflexionar sobre ellos.
¿Vamos a poder escribir sobre el bucle, dentro de diez años, con palabras que no provengan del bucle? Es una pregunta sin grandilocuencia. Es operativa.
Definiciones
Model collapse. Fenómeno documentado por Shumailov y otros (2024) por el que entrenar modelos generativos sobre la salida de modelos previos produce pérdida progresiva e irreversible de la cola de la distribución original. Las muestras raras desaparecen primero; la salida se hace más fluida y más estrecha.
Cola de la distribución. Parte de una distribución estadística donde residen los eventos poco frecuentes pero significativos. En un modelo de lenguaje, la cola contiene el léxico raro, las estructuras minoritarias y las referencias culturales periféricas. Su pérdida es indetectable mediante métricas de fluidez.
Recursive training. Práctica de entrenar un modelo sobre un corpus que contiene salida de modelos anteriores. Cuando el ciclo se repite a través de varias generaciones sin filtrado de procedencia, produce model collapse.
Procedencia de datos (data provenance). Marca verificable del origen de un fragmento de contenido: humano o sintético, con qué modelo se generó, en qué fecha, bajo qué condiciones. A escala web, no hay protocolo establecido que permita aplicar procedencia de manera fiable y universal.
Línea base humana. Corpus identificable de producción humana auditada, generalmente datado antes de la difusión masiva de modelos generativos, conservado como referencia estadística para el entrenamiento y la evaluación de modelos futuros.
Referencias
Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? Proceedings of FAccT 2021. Crítica precoz sobre la fluidez como métrica engañosa de calidad y sobre las implicaciones culturales del entrenamiento masivo.
Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Análisis de la cadena material y laboral del entrenamiento de modelos, incluyendo la economía oculta de los datasets de calidad.
Elazar, Y. et al. (2024). What's In My Big Data? ICLR 2024. arXiv: 2310.20707. Plataforma WIMBD para auditoría de corpus de entrenamiento; documenta la imposibilidad de medir directamente la proporción de contenido sintético una vez integrado.
Harvard Journal of Law & Technology Digest (2025). Model Collapse and the Right to Uncontaminated Human-Generated Data. Publicado en marzo de 2025. Discusión jurídica reciente sobre la emergencia de una categoría de derecho relacionada con la preservación de corpus humano auditado pre-generativo.
Shumailov, I., Shumaylov, Z., Zhao, Y., Gal, Y., Papernot, N. & Anderson, R. (2024). AI models collapse when trained on recursively generated data. Nature 631, 755–759. Demostración empírica de model collapse en VAE, GMM y modelos de lenguaje grandes, con análisis de la irreversibilidad de la pérdida de cola distribucional.
También te interesa
- La degradación del conocimiento
- La entropía del contenido digital
- El colapso del valor del contenido
- El dataset como ideología

Comentarios0
Todavía no hay comentarios.
Deja un comentario