En este artículo
- La caja negra como categoría de uso
- La diferencia con la IA generativa
- Opacidad natural, opacidad política
- Protestar sin alternativa
- Lo que la interpretabilidad intenta arañar
- La consecuencia política
Definiciones · Referencias · También te interesa · En otros sitios
Acepto sin protestar que no sé cómo funciona, y sé por qué lo acepto: protestar exige una alternativa y no la tengo a mano. Me dicen que la caja negra de la IA pertenece a la misma familia que la electricidad o el motor de combustión, cosas que uso a diario sin entenderlas. La comparación es tramposa. La electricidad obedece leyes físicas universales, públicas, reproducibles por cualquiera con la formación suficiente. La IA obedece a quien la entrenó, con criterios privados, revisables a discreción del operador, sin acceso público al corpus, al método ni a los pesos. Las dos opacidades se parecen por fuera —no entiendo lo que uso—. Por dentro no se parecen en nada.
La caja negra como categoría de uso
Antes de la IA generativa, el adulto medio de un país desarrollado ya convivía con un puñado de cajas negras consolidadas. La electricidad, el motor de combustión, el antibiótico, la conexión a internet. Nadie pierde el sueño por no saber qué ocurre dentro de un enchufe.
Esa tranquilidad no era ignorancia pura. Descansaba sobre una estructura implícita que rara vez verbalizamos: confío en la caja porque hay otros que sí la entienden, porque existe una regulación que la audita, porque hay procedimientos públicos para dirimir cuando algo sale mal, y porque puedo recurrir a una alternativa si esta concreta me falla. Cuatro patas. La electricidad doméstica las tiene las cuatro: normas técnicas que la regulan, instaladores certificados que la auditan, un régimen de responsabilidad civil que reparte culpas y un mercado de proveedores bajo regla común. El motor de combustión, también: homologación de tipo para venderlo, una ITV periódica que lo revisa, un fabricante que responde por sus defectos y decenas de modelos compitiendo. El antibiótico pasa por agencias del medicamento que lo aprueban, por la farmacovigilancia que lo sigue después y por un abanico de terapias sustitutas para casi cualquier cuadro. Internet se levantó sobre protocolos abiertos y obliga a la interoperabilidad, con proveedores múltiples y un régimen de neutralidad de red parcial en Europa.
Las cuatro cajas eran negras para el individuo y transparentes para el sistema que las vigila. La opacidad de uso resultaba admisible justamente porque la opacidad institucional no existía.
La diferencia con la IA generativa
La IA generativa rompe esas patas una por una, y no de forma cosmética.
La regulación llega tarde y a medias. El Reglamento europeo de IA (UE 2024/1689) establece el primer marco serio, pero su calendario va por detrás del despliegue: las obligaciones para los modelos de propósito general empezaron a aplicarse el 2 de agosto de 2025, la aplicación general se fija en agosto de 2026 y las exigencias más duras, las de los sistemas de alto riesgo del Anexo I, no entran hasta agosto de 2027. Para entonces, estas herramientas llevarán años instaladas en el trabajo de medio planeta. La auditoría externa, segunda pata, directamente no tiene equivalente. No hay ITV para un modelo generativo. Los institutos nacionales de seguridad de la IA que han ido apareciendo desde 2023 ensayan evaluaciones, pero sin capacidad ejecutiva real. Tampoco existen procedimientos públicos para resolver una controversia sobre lo que el modelo produce: cuando una respuesta difama, plagia o miente, el litigio acaba en tribunales ordinarios armados con marcos jurídicos que se escribieron pensando en otra cosa.
Queda la cuarta pata, la alternativa. Y aquí el problema es el tamaño del corral. El mercado de modelos generales está en manos de un puñado de empresas, con algún competidor asiático ganando peso. Puedo elegir entre ellas, sí, igual que puedo elegir el color del coche.
Las cuatro condiciones que sostenían la aceptación de la opacidad están erosionadas a la vez. La caja negra de la IA no se ha ganado la confianza por los mismos mecanismos que se la ganaron las cajas negras anteriores. La aceptamos de hecho. No de derecho.
Opacidad natural, opacidad política
La distinción que aquí importa no es mía. La investigadora Jenna Burrell la formalizó en 2016, en un artículo sobre cómo «piensa» la máquina publicado en Big Data & Society, donde separa tres clases de opacidad en los sistemas de aprendizaje automático.
La primera es la opacidad por secreto, corporativo o estatal: el dueño del sistema decide no enseñar cómo funciona. Es política, depende de una decisión de alguien con nombre y apellidos, y por tanto se puede revertir con presión social o con ley. La segunda es la opacidad por iliteracia técnica: los componentes son públicos, pero la mayoría del público no tiene la formación para leerlos. Es educativa, y se corrige enseñando. La tercera es la opacidad intrínseca de los propios métodos: aunque tengas el código y los pesos delante, la complejidad del modelo desborda lo que un cerebro humano puede seguir. Es estructural, y no se arregla revelando nada, porque no es cuestión de ocultación sino de escala.
En los modelos comerciales de hoy las tres se apilan. El usuario no ve el corpus de entrenamiento ni los pesos completos; la mayoría no sabría leerlos si los tuviera; y los investigadores que sí acceden solo descifran una parte de lo que el modelo hace.
La electricidad y el motor sufren únicamente la segunda. El usuario medio no domina la inducción electromagnética ni la termodinámica, pero ese conocimiento es público y cualquiera con la formación adecuada puede acceder, replicar y auditar. La IA generativa carga con las tres a la vez, y es la primera —la opacidad por secreto— la que la separa cualitativamente de las cajas viejas. Esa es política. Esa tiene dueño.
Protestar sin alternativa
Protestar de verdad, no de boquilla, requiere poder marcharse. Si el sistema A me parece inaceptable y existe un sistema B que no lo es, cambio y mando una señal de mercado. Sin B, mi protesta es decorativa.
Con la electricidad, el coche, el fármaco genérico o el proveedor de internet, ese B existe, imperfecto pero operativo. Con la IA generativa se estrecha por dos lados. Entre proveedores hay diferencias de margen y de enfoque, pero comparten lo de fondo: corpus en buena parte coincidentes, el mismo ajuste por refuerzo con preferencias humanas, la misma optimización medida con métodos parecidos. Cambiar de marca no es cambiar de arquitectura. Y respecto a abstenerse del todo, la puerta se cierra sola: en las profesiones que adoptan estas herramientas en bloque, el que se niega queda en desventaja, y la presión económica acaba decidiendo por él.
De ahí la consecuencia incómoda. Quien está insatisfecho con la opacidad no dispone de un mecanismo de protesta que muerda. Y su silencio, la ausencia de protesta visible, se lee desde fuera como un sí.
Conviene no tragarse esa lectura. Aceptación no es consentimiento. La aceptación es resignación operativa ante la falta de salidas. El consentimiento es elección informada entre opciones reales. La política democrática se construye sobre lo segundo; el mercado funciona a menudo con lo primero. La IA generativa, hoy, opera con aceptación disfrazada de consentimiento, y la diferencia no es semántica: es la distancia entre que te pregunten y que te den por preguntado.
Lo que la interpretabilidad intenta arañar
Contra la opacidad intrínseca trabaja un campo entero, el de la interpretabilidad mecánica, que pretende volver auditable, aunque sea a trozos, lo que el modelo hace por dentro. Los avances son reales y son modestos, las dos cosas a la vez.
El equipo de Chris Olah lleva desde 2021 publicando en el Transformer Circuits Thread de Anthropic intentos de aislar los circuitos internos responsables de comportamientos concretos. En octubre de 2023, Bricken, Templeton y otros sacaron Towards Monosemanticity, donde aplicaron autocodificadores dispersos —una técnica que descompone las activaciones internas en piezas más legibles— a un transformer de una sola capa, un modelo de juguete pensado para probar el método. El salto a un modelo real llegó en mayo de 2024 con Scaling Monosemanticity, de Templeton y colaboradores, que aplicó la misma idea a Claude 3 Sonnet y reportó la extracción de millones de rasgos identificables, algunos con control causal demostrado. El ejemplo que circuló fue el del rasgo «puente Golden Gate»: al forzar su activación, el modelo empezaba a hablar como si fuera el puente. Por su parte, el equipo de Superalignment de OpenAI, disuelto y reformulado en 2024, había publicado a finales de 2023 un trabajo sobre supervisar modelos muy capaces con señales humanas más débiles.
Todo esto matiza la opacidad intrínseca. No la elimina. La interpretabilidad de un modelo grande está hoy donde estaba la neuroanatomía en los años setenta: se localizan circuitos, se les atribuye una función, y queda una fracción enorme del sistema sin cartografiar. Hay un detalle que conviene retener antes de entusiasmarse: estos análisis no tocan la opacidad por secreto. El acceso a las propias herramientas de interpretación sigue siendo selectivo, y lo controla la empresa dueña del modelo. Se puede iluminar la caja desde dentro y mantener cerrada la puerta desde fuera.
La consecuencia política
Aquí dejo de describir y opino, aunque la opinión coincide con lo que la literatura sobre democracia algorítmica viene formulando desde antes de que existieran estos modelos. Aceptar la IA como caja negra se acerca peligrosamente a aceptar política sin democracia. El sistema toma decisiones que moldean la conversación pública, el mercado laboral y la información que nos llega, sin un procedimiento de control comparable al que, mal que bien, ejercemos sobre el Estado.
Frank Pasquale lo había anticipado en The Black Box Society (2015), entonces a propósito de los algoritmos de puntuación financiera y reputacional, y la crítica encajó sin esfuerzo en los modelos generativos. Su propuesta no era la transparencia total, que erosionaría los incentivos comerciales hasta hacer inviable el negocio, sino una transparencia cualificada: acceso restringido pero auditable por reguladores y por expertos externos certificados. La idea es sensata y está parcialmente recogida en el Reglamento europeo, que obliga a documentación técnica detallada y a evaluaciones de riesgo sistémico para los modelos de propósito general, con acceso de la Oficina Europea de IA. Si esa auditoría muerde o solo ladra es algo que veremos en los próximos años, no antes.
La electricidad merece la deferencia social que le damos. El motor también. El antibiótico, también. La IA generativa la merecerá en la medida exacta en que se construyan sus condiciones de legitimación —regulación que llegue a tiempo, auditoría con dientes, vías reales de controversia, alternativas que no sean el mismo modelo con otro logotipo—. Mientras tanto, lo único honesto es nombrar la diferencia entre la opacidad de un enchufe y la opacidad de un modelo, y no dejar que la costumbre de no entender el primero nos haga firmar en blanco el segundo.
Definiciones
Caja negra: sistema cuyo funcionamiento interno es desconocido para el observador, que solo puede ver entradas y salidas.
Opacidad por secreto: opacidad mantenida por decisión política o comercial del propietario del sistema, reversible mediante presión externa o regulación.
Opacidad intrínseca: opacidad propia de la complejidad del sistema, no eliminable por revelación porque excede la capacidad humana de procesamiento.
Interpretabilidad mecánica: campo de investigación dedicado a entender qué circuitos internos de un modelo de aprendizaje son responsables de qué comportamientos.
Autocodificador disperso (sparse autoencoder, SAE): técnica que descompone las activaciones internas de un modelo en combinaciones de rasgos (features) más interpretables.
Referencias
Burrell, J. — How the machine «thinks»: Understanding opacity in machine learning algorithms. Big Data & Society 3.1 (2016). Fuente de la distinción entre los tres tipos de opacidad.
Pasquale, F. — The Black Box Society: The Secret Algorithms That Control Money and Information (Harvard University Press, 2015). Origen de la noción de transparencia cualificada.
Bricken, T. et al. — Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. Transformer Circuits Thread (Anthropic, octubre 2023). Aplicación de autocodificadores dispersos a un transformer de una capa. https://transformer-circuits.pub/2023/monosemantic-features
Templeton, A. et al. — Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. Transformer Circuits Thread (Anthropic, mayo 2024). Aplicación a Claude 3 Sonnet y ejemplo del rasgo «Golden Gate Bridge».
Burns, C. et al. — Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision. arXiv:2312.09390 (OpenAI, 2023). Supervisión de modelos muy capaces con señales humanas más débiles.
Reglamento (UE) 2024/1689 — Reglamento europeo de inteligencia artificial. Calendario de aplicación: obligaciones para modelos de propósito general desde el 2 de agosto de 2025; aplicación general en agosto de 2026; sistemas de alto riesgo del Anexo I en agosto de 2027. https://artificialintelligenceact.eu/
Crawford, K. — Atlas of AI (Yale University Press, 2021). Contexto sobre la economía política de los sistemas de IA.

Comentarios0
Todavía no hay comentarios.
Deja un comentario