En este artículo
- La pieza que el discurso público ignora
- Lo que sí está documentado
- Common Crawl, hablando en cifras
- Lo que Crawford llamó cartografía
- El filtrado que también es opinión
- La consecuencia, donde aterriza
- Quién pondera, mejor pregunta que qué responde
Definiciones · Referencias · También te interesa · En otros sitios
Common Crawl, el corpus base de la mayoría de los modelos abiertos, ronda el cuarenta por ciento de contenido en inglés según las propias estadísticas públicas de la organización —la cifra exacta baila de un archivo mensual a otro—, y deja a las lenguas de bajos recursos en porcentajes ínfimos. Lo que se mete en el entrenamiento define lo que el modelo «piensa». Si el corpus es masivamente anglosajón, el modelo piensa en anglosajón y traduce el resto. Si excluyes ciertas fuentes, el modelo no las cita. La elección del dataset es la elección política más callada del sector. Los que la toman no se llaman a sí mismos políticos, pero deciden el aire que respira la inteligencia mundial.
La pieza que el discurso público ignora
Cuando se discute públicamente la regulación de la IA, el debate tiende a centrarse en dos puntos: la arquitectura del modelo y sus outputs. Cuánto puede hacer la red, qué dice y qué no debería decir, qué riesgos de seguridad genera. Hay una tercera pieza, intermedia, sobre la que se habla mucho menos, y que decide buena parte del resultado mucho antes de que la arquitectura procese nada. Esa pieza es el dataset de entrenamiento.
La razón por la que se habla poco no es académica. Es jurídica y comercial. La composición exacta de los corpus de los grandes modelos comerciales no es pública. Lo que sabemos del entrenamiento de GPT-4, Claude o Gemini son menciones genéricas en documentos de marketing y deducciones razonables a partir de comportamientos observados. Las empresas no publican el desglose porque buena parte del corpus se obtuvo con derechos sobre los que hay litigios abiertos, y porque la composición exacta es ventaja competitiva. La opacidad es funcional al negocio.
Donde sí se sabe la composición es en los corpus abiertos, y eso permite leer por extensión lo que probablemente ocurre en los cerrados. Y lo que se lee es incómodo si uno no es estadounidense, blanco, anglófono y nacido entre 1990 y 2015.
Lo que sí está documentado
Hay tres ejercicios de auditoría que conviene tener presentes para no hablar en abstracto.
El primero es Dodge, Sap, Marasović y otros, en Documenting Large Webtext Corpora. A Case Study on the Colossal Clean Crawled Corpus (EMNLP 2021, arXiv 2104.08758). Documenta la composición de C4, una versión filtrada y limpia de Common Crawl que ha entrenado a buena parte de la familia T5 y derivados. Encuentran tres cosas duras. Una, que el filtrado por blocklist excluye desproporcionadamente texto sobre y de minorías sexuales, raciales y religiosas: el filtro fue diseñado contra «contenido tóxico» y termina aplastando, además, texto inocuo sobre comunidades que los filtros heredaron como sospechosas. Dos, que parte importante del corpus contiene texto generado por máquina, ya en 2021. Tres, que dentro del corpus aparecen benchmarks de evaluación NLP, lo cual implica que cualquier modelo entrenado en él ha visto antes los exámenes con los que después se le califica.
El segundo es Gao, Biderman y otros, en The Pile. An 800GB Dataset of Diverse Text for Language Modeling (arXiv 2101.00027, 2020). Documentaron al detalle, por primera vez en este nivel, qué porción del corpus venía de qué fuente: Wikipedia, GitHub, libros, ArXiv, foros, prensa. The Pile sigue siendo de los pocos casos en los que se puede mirar dentro del dataset sin firmar un NDA, y por eso sigue siendo referencia obligada para entender qué se mete en la masa estadística que el modelo va a usar como mapa del mundo.
El tercero es Longpre y otros, en The Data Provenance Initiative. A Large Scale Audit of Dataset Licensing and Attribution in AI (Nature Machine Intelligence, 2024, arXiv 2310.16787). Auditaron más de mil ochocientos datasets de texto usados en la práctica para entrenar y evaluar modelos. Sobre los repositorios populares de descarga hallaron tasas de omisión de licencia por encima del setenta por ciento y errores de atribución o categorización por encima del cincuenta por ciento. No es una crítica woke ni un ataque al sector. Es una auditoría con cifras. Y la imagen general es que la disciplina de documentar la procedencia es excepcional, no estándar.
Common Crawl, hablando en cifras
Para no quedarse en abstracciones, conviene mirar lo que la propia Common Crawl Foundation publica en sus estadísticas. Las cifras varían según el archivo mensual porque el corpus crece y la composición se reequilibra, así que conviene tomarlas como orden de magnitud y no como dato fijo. En un archivo reciente el inglés es la lengua principal en torno al 41 % de los documentos. Por detrás, a mucha distancia, el ruso, el alemán, el japonés, el francés, el español y el chino se reparten una segunda franja en torno al 5 o 6 % cada uno, en cifras parecidas entre sí que bailan de un archivo a otro. Y debajo, un largo descenso hasta las decenas de lenguas que aparecen con porcentajes mínimos y los cientos de lenguas vivas que apenas asoman, o directamente no aparecen.
Léase con cuidado. La distribución de hablantes nativos en el mundo no se parece a esa distribución de tokens. El chino mandarín tiene más hablantes nativos que el inglés. El hindi tiene más que el español. Y en el corpus, la jerarquía la marca otra cosa: cuánto contenido digital escrito está disponible en cada lengua, lo cual a su vez depende de cuánto contenido se haya digitalizado, de qué plataformas tecnológicas se hayan usado, de qué hegemonía cultural haya empujado a publicar en una lengua frente a otra. El corpus refleja la historia digital del último cuarto de siglo, no la población lingüística del planeta.
Un modelo entrenado sobre esa distribución hereda esa historia. Cuando responde en español, lo hace con un español que conoce menos profundamente que el inglés. Cuando opina sobre un tema regional fuera del eje anglosajón, lo hace con menos masa estadística y por tanto con mayor margen de improvisación. Cuando elige ejemplos, los elige del país cuyo contenido pesa más. No es prejuicio del modelo. Es geometría del corpus.
Lo que Crawford llamó cartografía
Kate Crawford, en Atlas of AI (Yale University Press, 2021), hizo una observación que tardó en penetrar y que sigue siendo válida. El dataset, dice, no es una pieza neutral sobre la que se aplica una arquitectura neutra. Es cartografía. Y como toda cartografía, refleja decisiones: qué se incluye, qué escala se usa, qué se considera centro y qué periferia. Un mapa con el océano Pacífico al centro no es el mismo objeto que un mapa con el Atlántico al centro, aunque ambos representen exactamente la misma esfera. El centro decide qué se ve de un vistazo y qué requiere desplazamiento del ojo.
La elección del dataset opera con la misma lógica. Decide qué textos se ven de un vistazo y cuáles quedan en la periferia que el modelo solo alcanza con esfuerzo y con error creciente. Decide qué autores son la voz por defecto del corpus y cuáles aparecen como excepción. Decide qué países dan los ejemplos para todo lo demás. Lo decide en silencio, antes de que el modelo se haya entrenado, en una serie de hojas de cálculo que ningún regulador ha pedido públicamente nunca.
La diferencia con un mapa antiguo es que el mapa antiguo era declaradamente intencional. Mercator sabía que su proyección distorsionaba las latitudes altas; lo aceptaba a cambio de la utilidad para la navegación. Quien construye el corpus de un LLM no declara la distorsión. La distorsión llega al usuario como propiedad del modelo, no como decisión cartográfica.
El filtrado que también es opinión
Hay una segunda capa, más sutil, donde la decisión política se concentra y vuelve a invisibilizarse. Es el filtrado del corpus. No basta con elegir qué fuentes meter; hay que decidir qué quitar. Los corpus crudos son demasiado ruidosos, contienen spam, contienen contenido sexualmente explícito, contienen lenguaje violento, contienen textos generados por bots. Se filtran. La decisión de cómo filtrar tiene casi tanta importancia como la decisión de qué incluir.
Lo que Dodge y otros mostraron sobre C4 es que el filtrado por blocklist, montado con buenas intenciones, termina cortando texto valioso. Si tu blocklist contiene palabras del léxico LGBTQ, no solo quitas pornografía: quitas texto académico, periodístico y literario que las usa en sentido descriptivo. Si tu blocklist contiene términos políticos «cargados», no solo quitas propaganda: quitas análisis político serio. Y como el filtro se aplica con criterios anglosajones, idiomáticamente y culturalmente, los matices de otras lenguas y otras tradiciones quedan triturados por filtros pensados para inglés.
El criterio de qué se considera tóxico no es técnico. Es político en sentido estricto, en el sentido de Carl Schmitt aunque casi ningún ingeniero de datos haya leído a Schmitt. Lo decide quien escribe la blocklist. Y lo decide, por economía de gestión, sin consultar con las comunidades cuya producción cultural va a ser excluida.
No es una crítica desde una lectura woke automática, que el blog evita por principio. Es una observación operativa. El filtrado afecta a la base estadística del modelo, y la base estadística decide qué sale luego por la boca del modelo. Quien filtra opina, en silencio, sobre qué es decible y qué no, y su opinión se aplica a la voz de la inteligencia que doscientos países usarán para responderle a sus ciudadanos.
La consecuencia, donde aterriza
Para el usuario español, italiano, brasileño, indonesio o keniata, la consecuencia operativa es bastante uniforme. Las respuestas del modelo le llegan como si hubieran sido pensadas en inglés y traducidas mentalmente. Los marcos conceptuales son anglosajones por defecto: el «debate político» que aparece tiene la forma de la polarización estadounidense, los «valores familiares» tienen el matiz del cristianismo evangélico anglo, las «discusiones laborales» asumen el contrato individual norteamericano, los «sistemas educativos» de referencia son K-12 y universidades de la Ivy League. Cuando se pide al modelo que adapte al contexto local, lo hace, pero parte de un molde que no es local, y la traducción culturalmente nunca queda completa.
Esto no significa que el modelo discrimine activamente. Significa que su mediana ponderada es la del corpus, y la del corpus es la del mundo digital anglosajón hegemónico desde los noventa. Pedirle al modelo que opine como si no fuera ese mundo no anula la composición. La adapta superficialmente. Por debajo, los pesos del modelo siguen siendo los que son.
Bender y otros, en On the Dangers of Stochastic Parrots (FAccT 2021), llamaron la atención sobre este punto antes de que la masificación del producto hiciera evidente lo que implicaba. Cuando una comunidad entera comparte el mismo asistente, y el asistente piensa por defecto en una lengua y una cultura, la presión hacia esa lengua y esa cultura se vuelve infraestructural. No actúa como persuasión consciente. Actúa como fondo.
Safiya Umoja Noble, en Algorithms of Oppression (NYU Press, 2018), había documentado el mecanismo análogo en motores de búsqueda. Lo que aparece en los primeros resultados no es producto de una decisión editorial: es producto de un conjunto de decisiones técnicas que, agregadas, configuran un sesgo. Su lectura era específicamente racial. El argumento estructural sigue siendo aplicable al territorio LLM: la composición del corpus produce un sesgo agregado que actúa sin que nadie haya tenido que escribir la línea de código que lo declare.
Quién pondera, mejor pregunta que qué responde
La pregunta política seria sobre la IA actual no es qué responde un modelo en un debate particular. Esa pregunta entra fácil al debate público, da titulares, produce indignaciones cíclicas, y la industria sabe gestionarla con ajustes de post-training y filtros de salida. La pregunta seria, la difícil, es quién pondera.
Quién decidió que el corpus tuviera esa composición lingüística. Quién decidió qué fuentes filtrar. Quién decidió qué bibliotecas digitalizadas se incorporaban y cuáles se dejaban fuera. Quién decidió qué definición de «toxicidad» se usaría para podar. Quién decidió que los benchmarks acabaran dentro del corpus y nadie hiciera nada por evitarlo. La respuesta, casi siempre, es un equipo reducido de ingenieros en una empresa concreta, en un país concreto, con criterios que no se publican y que no se someten a auditoría externa.
Llamarlos políticos sería injusto en el sentido coloquial: no se ven a sí mismos como políticos, no se postulan a cargos, no responden ante un electorado. Llamarlos políticos es exacto en un sentido más amplio del término: el que ejerce, aunque no se nombre así, quien dispone de la capacidad de configurar el marco en el que otros tomarán luego sus decisiones.
Que la elección del dataset siga siendo discusión técnica, opaca, dispersa entre empresas con secretos comerciales protegidos, es la mayor cesión política tranquila del primer cuarto del siglo veintiuno. No hay manifestaciones por la composición del corpus. No hay debate parlamentario sobre la blocklist. No hay observatorios ciudadanos sobre la representación lingüística en los modelos que entran en uso público. Todo lo demás se discute. Eso, no.
Definiciones
Dataset / corpus. Conjunto estructurado de textos sobre el que se entrena un modelo de lenguaje. Su composición determina, en buena parte, la base estadística con la que el modelo responderá después.
Common Crawl. Fundación sin ánimo de lucro que rastrea la web pública desde 2008 y publica archivos mensuales del contenido recogido. Sus archivos son la base, directa o filtrada, de la mayoría de corpus abiertos.
C4 (Colossal Clean Crawled Corpus). Versión filtrada y limpia de Common Crawl, usada por la familia T5 de Google y derivados. Documentada por Dodge y otros (2021).
The Pile. Corpus de 800GB abierto, compuesto por veintidós fuentes documentadas (Wikipedia, GitHub, libros, ArXiv, etc.). Publicado por EleutherAI en 2020.
Blocklist. Lista de términos cuya aparición en un documento desencadena el filtrado del documento entero. Herramienta principal de filtrado por contenido en corpus a escala web.
Cartografía del dataset. Metáfora propuesta por Kate Crawford para subrayar que la composición de un corpus refleja decisiones de inclusión, escala y centro análogas a las de un mapa, no propiedades neutras de la realidad.
Contaminación de benchmark. Presencia de ejemplos de evaluación en el corpus de entrenamiento. Inflada artificialmente las puntuaciones del modelo en esos benchmarks. Documentada como problema sistémico desde 2021 (ver C4 en Dodge et al.).
Referencias
Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Marco general sobre el dataset como cartografía y la materialidad política de la IA.
Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Diagnóstico de cómo la composición del corpus se traslada al modelo y a sus salidas.
Noble, S. U. (2018). Algorithms of Oppression. How Search Engines Reinforce Racism. NYU Press. Documentación del sesgo agregado en sistemas algorítmicos, traspasable al territorio LLM.
Gao, L., Biderman, S. et al. (2020). The Pile. An 800GB Dataset of Diverse Text for Language Modeling. arXiv 2101.00027. Documentación detallada de composición de corpus, referencia obligada para entender qué se mete.
Dodge, J., Sap, M., Marasović, A. et al. (2021). Documenting Large Webtext Corpora. A Case Study on the Colossal Clean Crawled Corpus. EMNLP 2021. arXiv 2104.08758. Auditoría de C4: filtrado desproporcionado de minorías, presencia de texto generado por máquina, contaminación de benchmarks.
Longpre, S. et al. (2024). The Data Provenance Initiative. A Large Scale Audit of Dataset Licensing and Attribution in AI. Nature Machine Intelligence 6, 975–987. arXiv 2310.16787. Auditoría de más de mil ochocientos datasets de texto: omisión de licencias por encima del setenta por ciento y errores de atribución o categorización por encima del cincuenta por ciento en los repositorios populares.
Common Crawl Foundation. Statistics of Common Crawl Monthly Archives (estadísticas de lenguas). . Datos primarios sobre composición lingüística y temporal del archivo; los porcentajes citados corresponden a un archivo mensual reciente y varían entre archivos.
También te interesa
- Sesgos invisibles. El sesgo declarado se filtra, el de base sigue intacto
- La ilusión de neutralidad. Una IA neutral es una IA cuyo sesgo coincide con el tuyo
- Kate Crawford, el Atlas de la IA y lo que ha contado la prensa
- La IA invisible. La que decide sobre ti sin que sepas que existió la decisión

Comentarios0
Todavía no hay comentarios.
Deja un comentario