Cathy O'Neil y las armas matemáticas

En este artículo

  1. Quién es Cathy O'Neil
  2. La definición precisa
  3. Caso uno. COMPAS
  4. Caso dos. Los profesores de Washington
  5. Caso tres. Código postal y crédito
  6. El caso europeo. La toeslagenaffaire
  7. El test que propone O'Neil
  8. La conexión con la IA generativa

Definiciones · Referencias · También te interesa · En otros sitios

La cito desde hace años en discusiones sobre IA, y casi siempre la citan mal: reducida a un eslogan ingenioso sobre algoritmos malos. Cathy O'Neil estaba dentro de Wall Street cuando reventó el crack de 2008, vio cómo unos modelos matemáticos opacos firmaban hipotecas que arruinarían a familias enteras, y de ahí salió una categoría que conviene entender entera, no en tres palabras. Sus armas de destrucción matemática son anteriores a ChatGPT. Y son exactamente el problema que la IA generativa hereda y multiplica.

Quién es Cathy O'Neil

Importa por dónde llegó, porque define lo que escribió después. O'Neil se doctoró en matemáticas en Harvard en 1999 y dio clases en Barnard College antes de pasarse a las finanzas. En 2007 entró en el fondo cuantitativo D. E. Shaw, uno de los grandes de Wall Street, y de ahí a la firma de software de riesgo RiskMetrics. Estaba dentro del sector cuando los modelos de riesgo de crédito que se habían usado durante una década se desplomaron en 2008. Cayó Lehman. Empezó la crisis.

No fue víctima de aquello. Fue testigo desde el lado que lo provocó, y esa posición es la que da autoridad al libro. Vio cómo las matemáticas sofisticadas —Value at Risk, scoring de hipotecas subprime, probabilidad de impago— sirvieron de cobertura técnica a decisiones imprudentes, y cómo una cifra con apariencia de objetividad le permitía a un ejecutivo decir «lo dijo el modelo» y lavarse las manos.

Salió. Trabajó después como científica de datos en el ecosistema de la publicidad online neoyorquina —pasó por la startup Intent Media— y se implicó en el grupo de banca alternativa de Occupy Wall Street. Más adelante fundó ORCAA, una consultora de auditoría algorítmica. En 2016 publicó Weapons of Math Destruction, que entró en la longlist del National Book Award de aquel año y ganó después el Euler Book Prize de la asociación matemática americana. Casi diez años después sigue siendo la explicación más limpia que existe en inglés de por qué ciertos algoritmos hacen tanto daño y cuesta tanto frenarlos.

La definición precisa

O'Neil llama Arma de Destrucción Matemática (Weapon of Math Destruction, WMD) a un algoritmo que reúne tres rasgos a la vez. La conjunción es lo importante: si falta uno, hay como mucho un algoritmo mediocre, no un WMD.

El primero es la opacidad. Nadie de fuera puede inspeccionar cómo decide. A veces porque la empresa que lo construyó lo declara secreto comercial, que es lo más habitual; a veces porque el propio sistema —una red neuronal con cientos de millones de parámetros— es tan enrevesado que ni sus creadores saben explicar una decisión concreta.

El segundo es la escala. No hablamos de un juez o un seleccionador que decide cara a cara, con su margen de error humano y su posibilidad de rectificar. Hablamos de una decisión que se aplica de forma automática a poblaciones enteras, y a esa escala cualquier sesgo minúsculo se convierte en daño de masas.

El tercero es el daño asimétrico, y es el que casi nunca se entiende bien. El algoritmo no reparte el perjuicio de manera uniforme: castiga más a quien ya partía en desventaja. Aprende el sesgo que arrastran los datos con los que se entrenó, y como esos datos históricos llevan dentro las desigualdades sociales previas, el algoritmo las reproduce y las endurece.

Tres condiciones que se acumulan. La definición sirve, sobre todo, para distinguir el scoring crediticio del banco —candidato a WMD— del algoritmo que te recomienda canciones, donde hay escala y hay opacidad pero el daño asimétrico es despreciable.

Caso uno. COMPAS

COMPAS es un sistema de evaluación del riesgo de reincidencia que usan jueces en Estados Unidos para resolver sobre libertad condicional, fianzas y condenas. Lo desarrolló Northpointe, hoy Equivant, y lleva en uso desde principios de los 2000 en estados como Florida, Nueva York, Wisconsin o Arizona.

Funciona así. El acusado responde a un cuestionario de más de 130 preguntas sobre su historial, su familia, su barrio, sus estudios y sus relaciones; el algoritmo cruza esas respuestas con datos administrativos y devuelve una puntuación de riesgo del 1 al 10 que el juez tiene delante cuando decide.

En 2016, los periodistas de ProPublica —Julia Angwin, Jeff Larson, Surya Mattu y Lauren Kirchner— analizaron unos 7.000 casos del condado de Broward y publicaron lo que encontraron. La tasa de falsos positivos para personas negras era el doble que para personas blancas: el sistema predecía con casi el doble de frecuencia que una persona negra reincidiría cuando luego no lo hacía. Y al revés, etiquetaba como seguras a personas blancas que sí acabaron reincidiendo. Esto no es un sesgo abstracto que discutir en un seminario. Son años de cárcel para unos y la calle para otros, decididos en parte por una cifra opaca con sesgo documentado.

COMPAS cumple los tres rasgos. La opacidad es de manual, porque Northpointe se ampara en el secreto comercial para no enseñar la fórmula. La escala alcanza a cientos de miles de evaluados. Y el daño recae sobre la población negra, ya sobrerrepresentada en el sistema penal.

Northpointe rebatió a ProPublica, y la discusión técnica sobre qué métrica de equidad usar —calibración predictiva frente a paridad de error— es legítima y sigue viva entre estadísticos. Pero lo que esa pelea no toca es el fondo: una herramienta que decide sobre la libertad de personas concretas funciona por dentro de un modo que nadie ajeno puede revisar.

Caso dos. Los profesores de Washington

En 2009, las escuelas públicas de Washington D. C. estrenaron IMPACT, un sistema de evaluación docente que se apoyaba en parte en un modelo estadístico de «valor añadido». La idea era estimar cuánto aportaba cada profesor al progreso de sus alumnos en pruebas estandarizadas: el modelo predecía la nota que cada estudiante debería sacar según sus circunstancias —barrio, ingresos familiares, rendimiento previo— y al final de curso comparaba lo previsto con lo real. La diferencia se le atribuía al profesor.

El problema es estadístico antes que moral. Con muestras pequeñas, un profesor de veinte o treinta alumnos por curso, el margen de error es descomunal, hasta el punto de que muchos docentes resultaban indistinguibles entre sí dentro del ruido. Daba igual: la puntuación se usaba en serio, para bonus, ascensos y despidos.

O'Neil cuenta el caso de Sarah Wysocki, profesora en Washington a quien compañeros y familias tenían por excelente. Su puntuación IMPACT salió baja y la despidieron. Después se supo que las notas del año anterior, las que servían de base a la predicción, habían sido infladas por trampas administrativas en otra parte del sistema. El dato de entrada era falso, así que la predicción era falsa, y el modelo no tenía manera de saberlo. Wysocki perdió el trabajo por un ruido que ella no había generado.

En 2015, en Nueva York, el Board of Regents aprobó una moratoria de cuatro años al uso de las notas de los exámenes en la evaluación docente: una marcha atrás, forzada por la presión pública, frente a la política que el gobernador Andrew Cuomo había impulsado. Para Wysocki llegaba tarde.

Caso tres. Código postal y crédito

El tercer ejemplo central del libro es el scoring de crédito, pero no el FICO clásico, que es relativamente transparente, sino los scoring alternativos de las fintech, los prestamistas online y las plataformas de big data.

Esos modelos se alimentan de variables que parecen inocentes: el código postal, los hábitos de navegación, el dispositivo desde el que entras, cuánto tardas en leer cada pantalla, la hora a la que pides el préstamo. Aparentemente neutras. Pero en Estados Unidos el código postal lleva décadas correlacionado con la raza por culpa de la segregación residencial, de modo que tu barrio delata lo que la ley prohíbe usar de forma explícita.

El resultado es que los tipos de interés más altos recaen sistemáticamente sobre comunidades históricamente marginadas, no por las características financieras de cada persona sino por las estadísticas agregadas de su vecindario. Es lo que se ha llamado redlining algorítmico: la versión actual del redlining bancario de mediados del siglo XX, aquella práctica de negar servicios financieros por la composición racial de un barrio. Lo ilegalizaron, y el algoritmo lo reconstruye sin nombrar la raza, infiriéndola de variables correlacionadas.

¿Es un WMD? La opacidad está, porque esos scoring son secreto comercial. La escala está, con millones de solicitudes al año. Y el daño asimétrico es justamente lo que el libro de O'Neil documenta como patrón estructural de este tipo de modelos.

El caso europeo. La toeslagenaffaire

Para que no parezca un vicio solo americano, conviene mirar a los Países Bajos.

Entre 2005 y 2019, Hacienda (el Belastingdienst) usó un algoritmo de riesgo para decidir qué solicitudes de subsidio de guardería investigar por presunto fraude. El modelo trataba la nacionalidad extranjera, el origen étnico y los ingresos bajos como indicadores de sospecha. Unas 26.000 familias fueron acusadas falsamente. Se les reclamó la devolución de los subsidios cobrados, en muchos casos decenas de miles de euros de golpe. Hubo familias arruinadas, divorcios, niños retirados por los servicios sociales, suicidios.

Detrás había un mecanismo que O'Neil describe muy bien. El algoritmo amplificaba el sesgo de origen: ante la señal de unos pocos defraudadores de una nacionalidad, ponía bajo lupa a casi todos los residentes de esa nacionalidad, y al mirar solo a ese grupo generaba más casos en ese grupo, lo que confirmaba la sospecha de partida. Un bucle de retroalimentación que se alimenta de su propio prejuicio.

En enero de 2021, el gobierno completo de Mark Rutte dimitió por el escándalo. Cinco años después, las víctimas siguen peleando por una compensación que esté a la altura. Opacidad: los afectados no sabían siquiera por qué se les investigaba. Escala: decenas de miles de familias. Daño asimétrico: el golpe cayó sobre hogares migrantes y pobres. Y ocurrió en uno de los países con mejor reputación democrática y más presupuesto administrativo de Europa, que es la parte que debería quitar el sueño.

El test que propone O'Neil

Frente a un algoritmo que te aplican o que aplicas tú, O'Neil deja tres preguntas. ¿Es auditable, puede alguien de fuera mirar qué hace y por qué? Si la respuesta es no, sea por secreto comercial o por complejidad técnica, ya tienes un problema de opacidad. ¿A cuánta gente afecta? Una decisión humana individual conserva margen de revisión; una decisión automática sobre millones, no. ¿Castiga más a quien ya estaba abajo, y existe algún análisis del rendimiento desagregado por grupos protegidos? Cuando ese análisis no existe, lo prudente es presumir que el sesgo está ahí, porque los datos históricos casi siempre lo traen dentro.

Tres síes seguidos y lo que tienes delante ya no es una herramienta sino un arma, y el daño que va a hacer no será un accidente: estaba en el diseño.

La conexión con la IA generativa

Los WMD son anteriores a ChatGPT, y la IA generativa no cambia la categoría, la ensancha. Hay opacidad sobre cómo se filtra tu currículum antes de que lo vea un humano, ahora que los sistemas de seguimiento de candidatos extraen y puntúan candidaturas con modelos generativos. La hay sobre cómo se enriquece tu solicitud de crédito con datos recogidos en automático, sobre cómo se redactan los informes de antecedentes que consultan los empleadores, sobre qué le sugiere al juez un asistente jurídico antes de la vista.

Cada uno de esos sistemas mete la lógica que O'Neil describió en 2016 dentro de una escala nueva. El marco lo puso ella hace casi diez años; los casos los pone, sin parar, el propio sector. Y los tres rasgos siguen siendo el filtro más limpio para localizar dónde están los problemas que de verdad importan, justo cuando el ruido sobre la IA invita a mirar a cualquier otra parte.

Definiciones

Weapon of Math Destruction (WMD). Algoritmo que combina opacidad, escala y daño asimétrico. La categoría es de Cathy O'Neil, en su libro de 2016.

COMPAS. Siglas de Correctional Offender Management Profiling for Alternative Sanctions, un sistema de evaluación del riesgo de reincidencia usado en tribunales de Estados Unidos.

Modelo de valor añadido. Modelo estadístico que intenta estimar cuánto aporta un profesor (o cualquier agente) al rendimiento medido de los estudiantes, controlando por características previas.

Redlining. Práctica histórica de negar servicios financieros a los residentes de ciertos barrios según su composición racial; hoy reaparece en su versión algorítmica.

Toeslagenaffaire. Escándalo holandés del subsidio de guardería: unas 26.000 familias acusadas falsamente de fraude entre 2005 y 2019 por un algoritmo sesgado.

ORCAA. O'Neil Risk Consulting & Algorithmic Auditing, la consultora de auditoría algorítmica fundada por Cathy O'Neil.

Bucle de retroalimentación sesgado. Situación en que un algoritmo, al actuar solo sobre un subgrupo seleccionado, genera datos que confirman y refuerzan su propio sesgo de selección.

Referencias

Weapons of Math Destruction. How Big Data Increases Inequality and Threatens Democracy, de Cathy O'Neil (Crown, 2016), es la fuente del marco conceptual y de los casos de IMPACT y del scoring de crédito.

Machine Bias, de Julia Angwin, Jeff Larson, Surya Mattu y Lauren Kirchner (ProPublica, 23 de mayo de 2016), es la investigación sobre COMPAS en el condado de Broward.

La ficha biográfica de Cathy O'Neil en Wikipedia (en.wikipedia.org/wiki/Cathy_O'Neil) sustenta su trayectoria por D. E. Shaw, RiskMetrics, el sector publicitario neoyorquino e Intent Media, y la fundación de ORCAA.

La entrada de Wikipedia sobre Weapons of Math Destruction (en.wikipedia.org/wiki/Weapons_of_Math_Destruction) recoge la inclusión del libro en la longlist del National Book Award de 2016 y el Euler Book Prize.

La crónica de North Country Public Radio sobre la moratoria de evaluaciones docentes en Nueva York (northcountrypublicradio.org) documenta que la moratoria de 2015 fue aprobada por el Board of Regents, revirtiendo la política impulsada por el gobernador Cuomo.

Xenophobic Machines. Discrimination through unregulated use of algorithms in the Dutch childcare benefits scandal, de Amnistía Internacional (2021), documenta la toeslagenaffaire.

Automating Inequality, de Virginia Eubanks (St. Martin's Press, 2018), amplía el patrón de daño algorítmico sobre poblaciones vulnerables.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario