En este artículo
- La inercia que no se anuncia en la pantalla
- Tu currículum filtrado por una década
- El crédito como espejo de hace cinco años
- La paradoja del éxito
- El sesgo histórico vestido de objetividad
- La cara empírica del retraso
- Lo nuevo, ¿quién lo decide?
Definiciones · Referencias · También te interesa · En otros sitios
Los modelos que filtran currículums en grandes empresas operan con datos de contrataciones de los últimos diez años. Los que asignan puntuaciones de crédito miran tu historial y el de gente «como tú» de hace cinco años. Los que sugieren precios de vivienda funcionan con valores de hace dos. Cualquier decisión que tomes con apoyo de IA está mediada por datos que ya no representan el presente. Lo nuevo lo decides tú, lo decide ella, lo decide algo intermedio — y casi siempre lo decide ella sin que lo notes.
La inercia que no se anuncia en la pantalla
Todo dataset tiene fecha. Esa fecha es siempre anterior al momento en que el modelo se usa, y casi nunca aparece en la interfaz que el usuario ve. Cuando un sistema te ofrece una recomendación, una puntuación o un filtro, la palabra que vendría a tu cabeza si supieras lo que está pasando sería memoria, no anticipación. La máquina recuerda. Te devuelve la mediana estadística del periodo en que fue entrenada y te la presenta como diagnóstico del presente.
El asunto no es defecto ni descuido. Es estructura. El aprendizaje supervisado consiste, precisamente, en aprender regularidades de un conjunto histórico y aplicarlas a casos futuros bajo la asunción de que esos casos pertenecen a la misma distribución que el conjunto histórico. Mientras la asunción se mantiene, el sistema funciona. Cuando la realidad se mueve, el sistema sigue contestando con la fluidez de antes, ahora sobre un mundo que ya cambió. No te avisa.
Lo que diferencia este desfase de otros desfases tecnológicos es la invisibilidad operativa. Cuando un mapa de papel está obsoleto, lo notas porque la calle no aparece. Cuando un modelo está obsoleto, no lo notas porque te da una calle plausible que en realidad es la que había antes de que la rehicieran.
Tu currículum filtrado por una década
El caso canónico es el ATS, el sistema automático de tracking de candidatos que filtra los currículums antes de que un humano los vea. Amazon construyó uno entre 2014 y 2017 entrenado con currículums recibidos durante una década. El resultado fue documentado por Reuters en 2018: el sistema aprendió que los buenos candidatos de la última década habían sido mayoritariamente hombres, y penalizó sistemáticamente cualquier mención que sugiriera mujer en el currículum, hasta la palabra «women's» en «women's chess club». Amazon abandonó el proyecto. El detalle interesante no es el sesgo de género — eso ya tiene su propia literatura. El detalle es que el sistema funcionaba exactamente como debía funcionar. Estaba prediciendo, con precisión estadística, el tipo de candidato que la propia empresa había contratado durante diez años. Es decir, predecía continuidad, que es lo único que un sistema basado en aprendizaje sabe predecir.
El problema escala más allá del caso de Amazon. Fuller y otros, en Hidden Workers. Untapped Talent (Harvard Business School / Accenture, 2021), reportan que el 88 % de los encuestados reconoce que sus filtros automáticos descartan candidatos cualificados de alto perfil. Estiman en torno a veintisiete millones de hidden workers en Estados Unidos, perfiles que el sistema invisibiliza porque no se parecen a los perfiles que el sistema vio. Cuidadoras que pasaron años fuera del mercado laboral. Veteranos con historial atípico. Personas con discapacidad que solicitaron adaptaciones. Cualquier currículum que se desvíe lo bastante de la mediana histórica como para que el filtro lo lea como anomalía.
Aquí aparece el primer giro incómodo. Esta clase de fallo no es el resultado de una ideología, ni de un sesgo de los ingenieros que escribieron el código. Es el comportamiento esperado de un sistema cuya función es proyectar el pasado sobre el futuro. La empresa que adopta el ATS no recibe un asistente predictivo. Recibe un censor estadístico retroactivo vendido como filtro objetivo.
El crédito como espejo de hace cinco años
En crédito el mismo mecanismo opera con datasets más finos. Fuster y otros, en Predictably Unequal. The Effects of Machine Learning on Credit Markets (Journal of Finance, 2022), analizaron alrededor de diez millones de hipotecas estadounidenses concedidas entre 2009 y 2013 y compararon predicciones de impago con modelos logit clásicos y con árboles tipo Random Forest y XGBoost. El modelo de machine learning predecía mejor en agregado. Y, simultáneamente, ampliaba la dispersión de tipos de interés: distribuía mejor el coste del riesgo según el perfil estadístico, pero hacía que las prestatarias negras e hispanas terminaran, en agregado, pagando más. La flexibilidad ganada en precisión se gastaba en hacer más legibles los patrones históricos de impago, y esos patrones traían incrustada toda la geografía de la desigualdad financiera anterior.
El detalle que conviene retener no es moral. Es temporal. Un modelo entrenado en 2013 sigue operando en 2026 — o mejor dicho, su descendiente sí, retrabajado con datasets sucesivos pero arrastrando la inercia del corpus base — y cualquier cambio reciente en el comportamiento de impago de barrios concretos, generaciones concretas o sectores económicos concretos tarda años en filtrarse al peso que esos rasgos tienen en la decisión. La movilidad del perfil que está delante de la pantalla viaja más rápido que el peso estadístico que el modelo le asigna.
La paradoja del éxito
Hay una observación operativa que el negocio de la IA aprendió antes de tiempo y casi nadie verbaliza fuera de las reuniones internas. Cuando un sistema automatizado funciona razonablemente bien durante meses, deja de auditarse. Los analistas humanos que revisaban los outputs son reasignados. Los muestreos de control se espacian. Las tasas de queja caen porque los descartados no saben que fueron descartados por una máquina. El sistema entra en una zona oscura donde acertar es indistinguible de no estar mirando.
Es exactamente entonces cuando el problema de los datos antiguos empieza a morder. El mercado laboral pivotó con la pandemia. Los precios de la vivienda en ciudades medianas españolas se desfasaron en doce meses. Las cohortes de prestatarios cambiaron de hábitos. El género musical que en 2021 era marginal en el corpus es ahora el que escucha la mitad del país. El sistema, sin auditor, sigue produciendo la respuesta que producía. Acumula error invisible, decisión sobre decisión, sin que ningún umbral salte porque los umbrales se configuraron con los datos del periodo donde el sistema acertaba.
Aquí el cinismo barato dirá «pues hay que auditar más». Esa frase confunde el síntoma con el aparato. Auditar más cuesta tiempo y dinero y rompe el atractivo comercial principal del sistema, que es no necesitar humanos. Las empresas que sacarían provecho de auditar son, exactamente, las que no auditarán porque están comprando el sistema precisamente para no hacerlo.
El sesgo histórico vestido de objetividad
La parte que el discurso publicitario no toca con elegancia es esta. Cuando una decisión la toma un humano, hay alguien al que se le puede pedir cuentas. Cuando la toma un modelo, la respuesta institucional es que el modelo es objetivo. Cathy O'Neil, en Weapons of Math Destruction (Crown, 2016), llevaba ya entonces el concepto a su forma legible: los algoritmos comerciales codifican opiniones sobre el mundo, no medidas neutrales del mundo. La objetividad declarada del sistema es la decisión política de qué dataset eligió quien lo entrenó.
Virginia Eubanks, en Automating Inequality (St. Martin's, 2018), llevaba el argumento a casos concretos del sistema de servicios sociales estadounidense, donde el modelo de scoring de protección infantil de Allegheny County operaba con un histórico de denuncias que estaba previamente sesgado contra familias pobres y negras. El sistema reproducía el sesgo amplificado y lo presentaba a los trabajadores sociales como «recomendación basada en datos». La frase es interesante: técnicamente cierta, prácticamente engañosa. Sí, está basada en datos. Los datos son los que están sesgados.
Kate Crawford, en Atlas of AI (Yale University Press, 2021), generaliza el patrón. Cada modelo trae una arqueología. Hay un periodo, un sitio, un equipo y un sesgo de muestreo enterrados en el corpus, y todo eso opera detrás de cada predicción como capa fósil. La IA no es contemporánea de quien la usa. Es contemporánea del periodo en que fue entrenada, vestida con la interfaz del año en que se la usa.
La cara empírica del retraso
El caso ProPublica de COMPAS dio el ejemplo periodístico más conocido. Angwin y otros, en Machine Bias (ProPublica, 2016), documentaron que el sistema de evaluación de riesgo de reincidencia COMPAS, usado en tribunales del condado de Broward, asignaba a los acusados negros una puntuación alta de riesgo de reincidencia violenta con un 77 % más de probabilidad que a los acusados blancos, una vez controladas variables como antecedentes, edad y sexo. Dressel y Farid replicaron parte del análisis en The Accuracy, Fairness, and Limits of Predicting Recidivism (Science Advances, 2018) y añadieron una observación incómoda: COMPAS, con sus 137 variables, no era más preciso que un clasificador lineal con dos variables o que un grupo aleatorio de personas con cero formación jurídica. El sistema no estaba haciendo magia estadística. Estaba ejecutando una proyección razonable de patrones históricos de detención, condena y supervisión post-libertad, todos ellos cargados con la inercia racial del propio sistema judicial que producía los datos.
La discusión académica posterior se ha ido por la corrección de sesgo, los marcos de fairness, los esfuerzos de reentrenamiento. Es legítima. Lo que tiende a olvidar es el problema estructural. Aunque el sistema corrigiera el sesgo racial del histórico, seguiría siendo un sistema que decide presente con datos pretéritos. Y eso, en un dominio donde el comportamiento humano y la legislación cambian, es una elección de arquitectura que se vende como precisión.
Lo nuevo, ¿quién lo decide?
Hay una pregunta práctica que vale la pena hacerse antes de aceptar la mediación de un sistema automático. ¿Quién está decidiendo? Si el currículum lo filtra un ATS antes de que lo lea un humano, lo decide la máquina, con los criterios estadísticos de la década anterior. Si el precio de la casa que pones a la venta lo sugiere un comparador entrenado con transacciones de hace dos años, lo decide la máquina con la curva de precios de hace dos años, en un mercado que pivota cada seis meses. Si el seguro lo pone una tarifa dinámica que lee tu perfil contra cohortes pasadas, lo decide la máquina con la siniestralidad anterior.
El humano que aparece en el flujo aparece tarde, y aparece para confirmar. Esto es lo que la literatura de aviación llamó hace décadas automation bias: cuando un sistema automático sugiere una respuesta, los operadores humanos tienden a aceptarla, especialmente bajo carga cognitiva. El reclutador que recibe diez currículums prefiltrados por el ATS sobre los mil que llegaron raramente revisa el descarte. El trabajador social que ve un score alto raramente reanaliza el contexto familiar. La firma que ve la sugerencia del modelo de pricing raramente la baja. El humano que se incorpora al final del proceso no decide. Aprueba.
Y aquí la pregunta vuelve incómoda. ¿Es nuevo lo que decidimos cuando aprobamos la sugerencia que un sistema entrenado con datos antiguos ha producido para el caso de hoy? La pregunta no admite respuesta única. Admite la observación de que, en la mayor parte de los casos cotidianos, lo nuevo no aparece. Lo que aparece es la mediana del periodo de entrenamiento, ligeramente reescalada, presentada como dictamen sobre el presente. Lo que no se parece a esa mediana se llama anomalía, y la palabra anomalía es muy útil para sistemas que necesitan justificar el descarte sin tener que pensarlo.
Definiciones
ATS (Applicant Tracking System). Sistema automático de filtrado y clasificación de currículums utilizado por empresas para reducir el volumen de candidaturas que llegan a un revisor humano. Suele operar con modelos entrenados sobre el histórico de contrataciones de la propia empresa.
Distribución (en ML). Patrón estadístico de los datos sobre los que un modelo opera. Cuando los datos de uso «caen fuera de distribución» respecto a los de entrenamiento, el rendimiento del modelo se degrada sin que el modelo lo anuncie.
Hidden workers. Categoría definida por Fuller y otros (HBS / Accenture, 2021) para describir a los candidatos cualificados que los filtros automáticos descartan sistemáticamente por desviarse del perfil mediano histórico. Cuidadoras, veteranos, personas con discapacidad, perfiles con interrupciones de carrera.
Scoring. Asignación de una puntuación numérica a un perfil (crediticio, laboral, judicial, asegurador) generada por un modelo estadístico entrenado sobre casos pasados. La puntuación se usa como insumo de decisiones automatizadas o semiautomatizadas.
Automation bias. Tendencia documentada del operador humano a aceptar la sugerencia de un sistema automático, especialmente bajo presión de tiempo, sin verificar contra fuentes independientes.
Referencias
Angwin, J., Larson, J., Mattu, S. & Kirchner, L. (2016). Machine Bias. ProPublica. Investigación de referencia sobre el sesgo del sistema COMPAS en el condado de Broward, base empírica del debate sobre IA y justicia penal.
Crawford, K. (2021). Atlas of AI. Power, Politics, and the Planetary Costs of Artificial Intelligence. Yale University Press. Marco general sobre la arqueología material y temporal de los modelos comerciales.
Dastin, J. (2018). Amazon scraps secret AI recruiting tool that showed bias against women. Reuters, 10 de octubre. Cobertura periodística del caso Amazon, citado en el cuerpo del artículo.
Dressel, J. & Farid, H. (2018). The Accuracy, Fairness, and Limits of Predicting Recidivism. Science Advances, 4(1), eaao5580. Replicación del análisis ProPublica y demostración de que COMPAS no es más preciso que un clasificador lineal sencillo.
Eubanks, V. (2018). Automating Inequality. How High-Tech Tools Profile, Police, and Punish the Poor. St. Martin's Press. Casos del sistema de servicios sociales estadounidense, con análisis específico del scoring de protección infantil de Allegheny County.
Fuller, J., Raman, M., Sage-Gavin, E. & Hines, K. (2021). Hidden Workers. Untapped Talent. Harvard Business School Project on Managing the Future of Work / Accenture. Encuesta a más de dos mil empleadores y ocho mil empleados sobre el efecto de los filtros automáticos en el acceso al empleo.
Fuster, A., Goldsmith-Pinkham, P., Ramadorai, T. & Walther, A. (2022). Predictably Unequal? The Effects of Machine Learning on Credit Markets. The Journal of Finance, 77(1), 5–47. Estudio sobre diez millones de hipotecas estadounidenses; los modelos de machine learning aumentan la dispersión de tipos entre grupos respecto a los modelos clásicos.
O'Neil, C. (2016). Weapons of Math Destruction. How Big Data Increases Inequality and Threatens Democracy. Crown. Referencia central sobre el uso de modelos estadísticos opacos en decisiones de alto impacto, marco conceptual sobre objetividad declarada y arquitectura sesgada.
También te interesa
- El problema de entrenar con el pasado
- Sesgos invisibles
- Cathy O'Neil y las armas matemáticas
- El bucle de entrenamiento

Comentarios0
Todavía no hay comentarios.
Deja un comentario