La entropía del contenido digital. Todo el ruido al alcance

En este artículo

  1. La promesa fundacional y su reverso operativo
  2. El número que nadie publica con precisión
  3. La medida académica del declive
  4. La «dead internet theory» como descripción parcial
  5. SEO sintético, la economía de la abundancia barata
  6. La consecuencia que la métrica del usuario sí refleja
  7. La promesa, revertida

Definiciones · Referencias · También te interesa · En otros sitios

Un análisis de Graphite estimó que en noviembre de 2024 la cantidad de artículos nuevos generados por IA superó por primera vez a la de artículos escritos por humanos en la web, situando la proporción en torno al 50%. La cifra es discutida y mide artículos largos clasificados con un detector automático, no «todo el texto de internet», pero el sentido de la tendencia no admite mucha duda. Cada vez hay más contenido y cada vez aporta menos. La señal se diluye en ruido — generación automática, contenido reciclado, posts duplicados, SEO sintético. Buscar algo concreto en internet en 2026 ya es un acto cuasi arqueológico. La promesa de «todo el conocimiento al alcance» se está cumpliendo al revés: todo el ruido al alcance.

La promesa fundacional y su reverso operativo

A finales de los noventa la web vendía una promesa concreta: todo el conocimiento del mundo, accesible desde cualquier sitio, gratis o casi. Era una promesa fuerte y, durante una década larga, se cumplió mejor de lo que parecía razonable. Wikipedia, los repositorios académicos, los foros técnicos, los blogs personales, las grandes bibliotecas digitalizadas. Buscar una respuesta a una pregunta concreta funcionaba. El motor de búsqueda devolvía resultados que valían la pena leer.

La promesa sigue impresa en las páginas de marketing. Lo que ha cambiado es la operativa. En 2026, buscar una respuesta concreta a una pregunta concreta es un ejercicio que pide entrenamiento. El usuario que recuerda cómo era buscar en 2010 nota la fricción. El usuario que sólo conoce el presente la asume como condición normal: lo razonable es que las primeras pantallas de resultados sean granjas de SEO, contenido generado por IA, listicles sin firma, agregadores de agregadores, y que el contenido útil aparezca, si aparece, escondido en la página tres o tras añadir tres operadores al query.

Esto no es nostalgia. Es un cambio medible.

El número que nadie publica con precisión

Cuánto del texto publicado en la web abierta es ya output de IA generativa es una cifra discutida y conviene tratarla con la cautela que merece. Las estimaciones que circulan tienen sesgo de fuente: las empresas que venden detectores tienen incentivo a publicar cifras altas, las empresas que producen modelos tienen incentivo a no publicarlas. No existe un censo independiente con metodología auditable. El dato más citado, el de Graphite, mide un universo acotado —artículos web largos clasificados por un detector automático— y no «todo el texto nuevo de internet»; tomar esa cifra como si midiera el conjunto de la web sería extenderla más allá de lo que su autor afirma. El propio análisis matiza, además, que esos artículos generados por IA aparecen mucho menos en los primeros resultados de Google de lo que su volumen de publicación sugiere.

Las cifras que sí están bien documentadas se refieren a fenómenos adyacentes. NewsGuard, en su rastreo continuo de sitios identificados como Unreliable AI-Generated News (UAIN), había catalogado más de mil sitios cuyo modelo de producción es generación automatizada masiva, una cifra que su propio centro de seguimiento describe en crecimiento sostenido. La cifra es periodística-comercial y conviene tomarla como indicativo. El indicio cualitativo, sin embargo, no admite mucha duda: hay un volumen creciente, no pequeño, de producción web cuya finalidad económica es ocupar espacio indexado sin proporcionar a un lector humano algo que justifique el clic.

El segundo indicio es el cambio de comportamiento del usuario. Es un fenómeno ampliamente reportado, aunque sin una cifra dura única que lo cuantifique: cada vez más gente añade la palabra «reddit» al final del query de Google para esquivar los primeros resultados algorítmicos y llegar a foros con respuestas humanas. Es un parche, una operación de evasión cuya existencia confirma lo que las cifras intentan medir.

La medida académica del declive

Bevendorff y otros, en Is Google Getting Worse? A Longitudinal Investigation of SEO Spam in Search Engines (ECIR 2024), construyeron un estudio longitudinal de las SERPs (Search Engine Result Pages) de Google, Bing y DuckDuckGo en el género de reviews de producto. Lo que encontraron sostiene la intuición del usuario con datos. Una fracción minoritaria de las reviews de producto en la web abierta usa marketing de afiliación, pero la mayoría de los resultados de búsqueda en los tres motores son de páginas con marketing de afiliación. La proporción se ha desplazado: lo que en la web abierta es minoritario en producción se vuelve mayoritario en visibilidad. El estudio concluye observando que la línea entre contenido y granja se ha vuelto progresivamente más borrosa, y que la situación «seguramente empeorará a la luz de la IA generativa».

Los autores no son polemistas. Son investigadores de recuperación de información publicando en una conferencia revisada por pares. Lo que dicen sin retórica es lo que el usuario nota sin saber decirlo: el motor que tenía como única función ordenar el corpus por relevancia se ha vuelto poroso a una clase de contenido cuya finalidad es manipular el orden por relevancia, y los productores de esa clase de contenido tienen, en 2026, herramientas de generación que les permiten producir a coste cero lo que antes tenía coste alto.

La «dead internet theory» como descripción parcial

Hubo un meme, hacia 2021, que afirmaba que la mayor parte del internet ya estaba muerto: que la gran mayoría del contenido era generado por bots, que las interacciones eran sintéticas, que los humanos sobrevivientes navegaban por un espacio ya muerto sin saberlo. Se llamó dead internet theory. Inicialmente circuló como conspiración. La afirmación literal — que «todo» es bot — era falsa. La afirmación dirigida — que una proporción creciente de la producción y de la interacción ya no es humana — se ha ido vistiendo de respetabilidad académica conforme la IA generativa amplió su despliegue.

Yoshija Walter, en Baudrillard and the Dead Internet Theory. Revisiting Baudrillard's (dis)trust in Artificial Intelligence (Philosophy & Technology, Springer, 2025), trata el concepto como problema filosófico no como tesis empírica, y conviene leerlo en ese registro. Lo que importa para una discusión seria no es si la teoría es literalmente cierta. Es si su núcleo descriptivo — que el canal está perdiendo su condición de espacio de comunicación humana mayoritaria — captura algo del estado del medio. La respuesta, a la vista de los datos parciales disponibles, es que sí captura algo. La proporción de interacción humano-humano sin mediación de sistemas que ya producen y filtran contenido se ha reducido. No a cero. Pero no es la que era.

SEO sintético, la economía de la abundancia barata

Conviene nombrar el mecanismo económico sin moralina. Producir contenido cuesta dinero. Un artículo bien escrito, con investigación y verificación, lleva horas. Un artículo generado por IA sobre el mismo tema, lo bastante decente para indexar, cuesta céntimos. La estructura de costes del que produce contenido de calidad y la del que produce SEO sintético no son comparables. Y el motor de búsqueda, mientras no haya un filtro robusto de procedencia, ranquea en función de señales — backlinks, freshness, keywords, tiempo en página — que el productor sintético sabe manipular con la misma eficacia que el productor humano, a coste mucho menor.

El resultado es predecible. La curva de cantidad de contenido publicada crece exponencialmente. La curva de contenido cuidado por un autor humano crece a velocidad humana. La proporción entre las dos curvas se desplaza año tras año. Y el motor de búsqueda, que opera sobre la unión de ambas, ve cada vez menos señal por unidad de muestra. Es entropía de Shannon llevada al canal informativo público.

Aquí toca evitar el tono dramático. El contenido de calidad sigue existiendo. Los sitios cuidados siguen produciéndose. El usuario que sabe lo que busca puede encontrar lo que busca si está dispuesto a pagar el coste de búsqueda. La diferencia es que el coste de búsqueda ha subido. Y eso, en términos económicos, significa que la información ha dejado de ser libre en el sentido que la promesa fundacional vendía. Es libre de pagar al autor, no es libre del coste de buscar. Bender, Gebru, McMillan-Major y Shmitchell avisaron en On the Dangers of Stochastic Parrots (2021) de exactamente este escenario; Nicholas Carr llevaba desde The Shallows (2010) sosteniendo que la mediación web altera la forma de leer y pensar, no solo el inventario disponible; Kate Crawford recordó en Atlas of AI (2021) que el sistema productor y filtrador de ese contenido es una industria con economía propia, no un repositorio académico neutro. Las tres advertencias son anteriores al despliegue generativo masivo. Las tres se están comprobando ahora.

La consecuencia que la métrica del usuario sí refleja

Hay un dato que conviene atender porque es del usuario mismo. La adopción acelerada de asistentes conversacionales — ChatGPT, Claude, Gemini, Perplexity — como sustituto del buscador clásico no es una moda. Es una respuesta racional al deterioro de la búsqueda tradicional. El usuario que ya no encuentra rápido lo que quiere en Google migra a un sistema que le da una respuesta sintetizada en una pantalla, aunque sepa que la respuesta puede tener errores. Está pagando el error a cambio de no pagar el coste de búsqueda.

Es una operación parcialmente racional. El asistente conversacional resume sobre un corpus contaminado por el mismo problema. Cuando contesta, mezcla aciertos sobre la moda con errores plausibles sobre la cola. La respuesta llega rápida y, en muchos casos, suficiente. En otros, falsa. Y como la fluidez es uniforme y la fiabilidad es disímil, el usuario no tiene marcadores fáciles para distinguir un caso del otro.

La interfaz conversacional resuelve el síntoma sin resolver la enfermedad. Hace habitable el ruido. Y al hacerlo habitable, legitima la persistencia del ruido, porque desplaza la demanda del eslabón anterior — el motor de búsqueda funcional — hacia un eslabón posterior que se conforma con sintetizar lo que hay, sin pagar el coste de mejorar la fuente.

La promesa, revertida

La frase «todo el conocimiento al alcance» tenía como sujeto al usuario y como verbo la disponibilidad. El verbo se cumplió. El sujeto se desplazó. Lo que está al alcance de cualquiera con conexión es, hoy, toda la producción: la cuidada, la barata, la falsa, la honesta, la generada, la copiada, la traducida, la repetida. El alcance no discrimina. La discriminación es operación humana, y el coste humano de discriminar ha subido al mismo tiempo que el alcance se cumplía.

¿Es esto un fracaso de la promesa o su cumplimiento literal con efectos secundarios no anunciados? Las dos lecturas son legítimas. Lo que no es legítimo es seguir vendiéndola con la misma cara de 1998. El sintagma «todo el conocimiento al alcance» y el sintagma «todo el ruido al alcance» describen, ya en 2026, el mismo objeto. La diferencia entre ambos no está en la web. Está en el lector que la atraviesa.

Definiciones

Entropía de Shannon. Medida formal del contenido informativo de una distribución. Cuando una fuente emite cada vez más señales con cada vez menos sorpresa media, su entropía útil por unidad emitida disminuye.

SERP (Search Engine Result Page). Página de resultados que un motor de búsqueda devuelve a un query. Los estudios de calidad de búsqueda miden la proporción de resultados relevantes, spam o contenido afiliado en las primeras posiciones.

SEO (Search Engine Optimization). Conjunto de prácticas para que el contenido se posicione en las primeras páginas de los motores de búsqueda. Cuando esas prácticas se aplican a contenido cuyo objetivo es indexar más que informar, se habla de SEO spam o granja de contenido.

UAIN (Unreliable AI-Generated News site). Categoría usada por NewsGuard para sitios web cuyo modelo de producción es generación automática masiva sin estándares editoriales verificables.

Dead Internet Theory. Tesis informal según la cual una proporción creciente del contenido y de la interacción en la web es generada o mediada por sistemas automáticos en lugar de humanos. Su versión literal es falsa; su núcleo descriptivo señala un cambio cuantitativo real.

Referencias

Graphite. More Articles Are Now Created by AI Than Humans. Análisis que sitúa en noviembre de 2024 el punto en que el volumen de artículos web nuevos generados por IA superó al de los escritos por humanos —en torno al 50% sobre una muestra de artículos largos clasificados con un detector automático—, señalando a la vez que esos artículos aparecen poco en los primeros resultados de Google.

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. Advertencia precoz sobre los efectos culturales del despliegue masivo de generadores de texto.

Bevendorff, J., Wiegmann, M., Potthast, M. & Stein, B. (2024). Is Google Getting Worse? A Longitudinal Investigation of SEO Spam in Search Engines. ECIR 2024. Estudio empírico sobre la calidad longitudinal de Google, Bing y DuckDuckGo en el género de reviews de producto.

Carr, N. (2010). The Shallows. What the Internet Is Doing to Our Brains. W. W. Norton. Marco histórico sobre las consecuencias cognitivas de la mediación web, anterior al despliegue generativo pero relevante para la lectura de su prolongación.

Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Referencia general sobre la economía y la materialidad de los sistemas que producen y filtran el contenido.

NewsGuard. AI Tracking Center. Tracking AI-enabled Misinformation. Rastreo continuo de sitios catalogados como UAIN, con crecimiento documentado por su propio centro de seguimiento.

Walter, Y. (2025). Baudrillard and the Dead Internet Theory. Revisiting Baudrillard's (dis)trust in Artificial Intelligence. Philosophy & Technology, 38:54, Springer. Discusión filosófica de la teoría del internet muerto como problema sobre la condición del canal, más allá de su lectura literal.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario