En este artículo
- Lo que la métrica decidió no ver
- El estudio que contó las dos cosas
- Cuatro oficios donde la cola es el oficio
- Cuando la cifra inflada manda en las decisiones grandes
- Lo que haría falta medir y todavía no se mide
Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios
Hago más. Lo noto cada mañana, cuando despacho en una hora lo que antes me llevaba tres. Lo que no sé es si hago mejor, y sospecho que la distancia entre esas dos preguntas es justo lo que la métrica de productividad ha decidido no mirar. El número sube, la cifra de «output por hora» se dispara con la IA, y un número que cuenta cuántas cosas produzco sin preguntarse si alguna valía la pena no está midiendo productividad: está midiendo ruido con buena prensa.
Lo que la métrica decidió no ver
La productividad económica se mide, en lo esencial, dividiendo. Cantidad producida entre horas trabajadas, o cantidad producida entre número de trabajadores. La OECD, Eurostat y el Bureau of Labor Statistics estadounidense llevan décadas publicando series largas con esas dos varas, que son las que tenemos y son varas de cantidad.
Durante mucho tiempo bastaron. En una economía de acero y carretera, la cantidad correlacionaba razonablemente bien con el valor: más toneladas eran más puentes, más kilómetros eran más comercio, y un informe de más no le costaba nada a nadie porque casi nadie producía informes. Esa correlación silenciosa entre cantidad y valor es la viga que sostiene toda la contabilidad de la productividad. Es también la que la economía cognitiva lleva años partiendo por la mitad sin que la métrica se haya dado por enterada.
Porque la vara no pesa la calidad. Un informe mediocre y un informe excelente entran en la estadística como dos informes, idénticos. Tampoco pesa la necesidad: diez documentos que nadie pidió cuentan diez; uno imprescindible cuenta uno. Y como ignora la distribución, cuando la media sube mientras la cola —los casos críticos, los raros— se degrada, el agregado canta victoria precisamente donde más se está perdiendo. Lo que no ve, sobre todo, son los costes que el output rápido empuja fuera del encuadre. Si lo que produzco deprisa obliga a quien lo recibe a filtrar la basura antes de usarlo, el coste no se ha evaporado: se ha mudado al despacho de al lado, donde ninguna estadística lo va a buscar.
La vara sigue ahí, intacta, por una razón que no tiene nada de noble. Es lo que sabemos medir.
El estudio que contó las dos cosas
Antes de seguir conviene mirar los datos, porque hay datos y no todos dicen lo mismo, y la diferencia entre ellos es el artículo entero.
Brynjolfsson, Li y Raymond observaron lo que ocurría cuando un asistente conversacional entraba en un centro de atención al cliente con más de cinco mil agentes. El incremento medio de productividad rondó el 14 %, con saltos del 34 % entre los trabajadores menos experimentados y un efecto prácticamente nulo entre los más expertos. La IA, sostenían, parece difundir hacia abajo las buenas prácticas de los mejores. Hasta ahí, la historia que todo el mundo repite en las presentaciones.
Dell'Acqua y sus coautores hicieron algo bastante más incómodo. En lugar de medir una media, separaron las tareas según cayeran dentro o fuera de lo que el modelo domina. Con consultores de Boston Consulting Group y GPT-4, quienes usaban IA en tareas dentro de esa frontera de capacidad fueron en torno a un 25 % más rápidos y entregaron resultados de mayor calidad. Pero en un problema diseñado a propósito para caer fuera de la frontera, en lo que el modelo no maneja bien, los usuarios de IA acertaron menos que el grupo que trabajaba sin ella. La herramienta no avisa de dónde está el borde. Empuja con la misma confianza a un lado y al otro.
El patrón reaparece en el código, y reaparece partido en dos. Peng y sus colegas cronometraron a desarrolladores escribiendo un servidor con GitHub Copilot y los vieron terminar casi un 56 % más rápido que el grupo de control. Esa velocidad es real y está medida con limpieza de laboratorio. Lo que el experimento no podía medir era qué le ocurre a ese código tres meses más tarde. Ahí entra GitClear, que en vez de cronometrar una tarea aislada se puso a leer el historial de cientos de millones de líneas reales. Su retrato es el reverso exacto del optimismo. El churn —líneas revertidas en las dos semanas siguientes a escribirse— ha ido subiendo de forma sostenida; la duplicación de bloques de código se ha disparado; y la refactorización se ha hundido hasta quedar por debajo del simple copia-pega por primera vez. La velocidad sube. La salud de la base de código baja, y baja justo en la dimensión que ningún cronómetro de productividad registra.
Ahí está la asimetría que importa. No es que la IA produzca peor output medio. Es que mejora donde la media manda y se desentiende —cuando no degrada directamente— donde lo que manda es la cola.
Cuatro oficios donde la cola es el oficio
Hay trabajos cuya distribución de criticidad está volcada hacia los pocos casos raros. El grueso es rutina, y el valor entero del oficio vive en la minoría difícil. Aplicar a esos trabajos una métrica de cantidad no es ser impreciso: es estar mirando al lado contrario de donde pasa lo importante.
Programar es el caso de manual. La mayor parte del código es fontanería que cualquier modelo escribe sin despeinarse, y luego está esa fracción donde viven los bugs caros, las decisiones de arquitectura que sostienen el sistema entero, el componente de seguridad que no puede fallar porque si falla no se mide en minutos sino en brechas. La IA acelera la fontanería, sí. Sobre el resto, la investigación de Apiiro acerca del código asistido apunta a un aumento de hallazgos de seguridad y de superficie de ataque a medida que crece el volumen generado. La estadística de productividad ve la fontanería más rápida y no ve la brecha, porque la brecha no es un output: es la ausencia de uno que debería haber existido y no existió.
El diagnóstico médico tiene la misma silueta. La consulta general despacha lo típico en cadena, y el juicio del médico se gana de verdad en el cáncer infrecuente, en la presentación atípica de una enfermedad común, en la comorbilidad que no encaja en ningún protocolo. No dispongo de un dato cerrado que cuantifique cuánto se relaja la atención de un clínico que se apoya en el modelo para los casos raros, y prefiero no inventarlo. Pero la lógica del sistema no necesita cifra para verse: un asistente que acierta lo típico el noventa por ciento de las veces educa al médico a confiar, y la confianza es exactamente lo que sobra en el caso atípico, donde lo que hace falta es desconfiar.
El derecho repite el esquema con cláusulas. Las estándar son repetición pura y la automatización las despacha sin esfuerzo; las distintivas son donde está la negociación que justifica los honorarios. La revisión científica lo lleva al extremo: resumir un paper es trivial y los modelos resumen de maravilla, pero detectar el fallo metodológico escondido que invalida la conclusión es lo difícil del oficio, y es justo lo que peor hacen.
En los cuatro casos la productividad medida sube, porque cuenta outputs sin ponderar cuál de ellos importaba. La calidad en los casos que de verdad deciden el oficio baja. Y la distancia entre lo que dice el número y lo que pasa en la mesa de operaciones, en el contrato o en el repositorio deja de ser un margen de error razonable para convertirse en estructura.
Cuando la cifra inflada manda en las decisiones grandes
Lo que viene ahora es lectura mía, no resultado de ningún estudio, y conviene decirlo antes de seguir. Lo que sí tiene apellido es la sospecha de fondo, que viene de lejos.
Charles Goodhart enunció en 1975, a propósito de la gestión monetaria británica, una idea que luego se haría célebre: cualquier regularidad estadística observada tiende a desmoronarse en cuanto se la presiona con fines de control. La formulación pegadiza que casi todo el mundo cita —«cuando una medida se convierte en objetivo, deja de ser una buena medida»— no es de Goodhart, sino de la antropóloga Marilyn Strathern, que la acuñó en 1997 condensando aquella intuición. El mecanismo es siempre el mismo: la gente optimiza la medida, no el fenómeno que la medida pretendía capturar. Trasládese a la productividad asistida por IA. Profesionales y empresas optimizan el output medido, no la calidad real, y el indicador se va volviendo una señal cada vez más floja sobre aquello que decía representar.
Y aquí es donde una cifra demasiado optimista deja de ser un detalle técnico. Los bancos centrales usan estimaciones de productividad para inferir cuánto puede crecer una economía sin recalentarse; si la productividad real es menor que la reportada porque la calidad se cae en la cola, los tipos de interés se fijan sobre un optimismo que nadie ha verificado. Los grandes programas de inversión pública en digitalización —el Next Generation europeo, la IRA estadounidense— financian la adopción de IA contando retornos basados en productividad medida, de modo que, si la medida está hinchada, la rentabilidad social que prometen es menor que la del folleto. La política laboral calibra el ritmo del reciclaje y la formación sobre proyecciones sectoriales que, sobrestimadas, llegan tarde o sobran donde no hacían falta. Y dentro de cada empresa, plantilla, formación e inversión se deciden sobre un output que miente precisamente sobre los casos críticos, que es donde se concentran las pérdidas que nadie está contabilizando.
No es que falte un dato. Es que el dato que sobra se ha vuelto el que manda.
Lo que haría falta medir y todavía no se mide
Las varas capaces de capturar lo que las clásicas se dejan existen, pero en estado embrionario, sueltas, sin agregarse a ningún panel macro.
En código se habla del defect escape rate, la proporción de defectos que llegan a producción sin haber sido detectados antes; en medicina, de los resultados clínicos adversos que aparecen en la cola larga; en derecho, de la tasa de cláusulas que terminan generando litigio. Son métricas de calidad sostenida, no de velocidad, y miran hacia donde la cantidad no mira. El problema es que se quedan en el repositorio, el hospital o el bufete concreto sin subir nunca a un agregado. Más difícil aún es medir el coste que el output rápido carga sobre quien lo recibe —cuánto tiempo le cuesta a alguien procesar lo que tú generas en un minuto—, una cifra que casi nadie reporta porque equivale a admitir que la velocidad de uno es la lentitud de otro. Y la más exigente de todas sería ponderar cada output por la importancia del caso, lo que obliga a clasificar antes los casos por criticidad, tarea que el sistema, cómodo en su agregado, no tiene el menor interés en hacer.
Mientras esas varas no maduren, la productividad que se reporta seguirá siendo la inflada, las decisiones seguirán tomándose sobre ella, y la grieta entre lo medido y lo real seguirá ensanchándose con la tranquilidad de quien repasa una hoja de cálculo donde todo cuadra. Cuadra porque solo cuenta lo que sabe contar. Y lo que no sabe contar es, cada vez más, lo único que importaba.
Definiciones
Output por hora trabajada. Cantidad producida dividida por horas empleadas. Es la métrica de productividad laboral más usada en las series oficiales; mide volumen, no valor ni calidad.
Frontera de capacidad del modelo (en inglés, jagged frontier, frontera dentada). Conjunto irregular de tareas donde un modelo de IA opera con calidad, rodeado de tareas aparentemente similares en las que falla. Concepto operativizado por Dell'Acqua y coautores (2023).
Cola larga de criticidad. La minoría de casos cuya importancia es desproporcionadamente alta respecto a su frecuencia. Patrón habitual en oficios profesionales, donde el grueso es rutina y el valor se concentra en lo infrecuente.
Churn de código. Líneas de código revertidas o reescritas en las semanas siguientes a su creación. Un churn alto sugiere código que no aguanta y debe rehacerse pronto.
Defect escape rate. Proporción de defectos que llegan a producción sin haber sido detectados antes. Métrica de calidad sostenida en ingeniería de software.
Ley de Goodhart. Idea según la cual una regularidad estadística deja de ser fiable en cuanto se la usa como objetivo de control. Enunciada por Charles Goodhart en 1975; la formulación popular es de Marilyn Strathern (1997).
Referencias
Brynjolfsson, E., Li, D. & Raymond, L. — Generative AI at Work, NBER Working Paper 31161 (2023). Estudio sobre más de cinco mil agentes de atención al cliente: incremento medio de productividad cercano al 14 % y del 34 % entre los menos experimentados, con efecto mínimo entre los más expertos. https://www.nber.org/papers/w31161
Dell'Acqua, F. et al. — Navigating the Jagged Technological Frontier. Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality, Harvard Business School Working Paper 24-013 (2023). Consultores de BCG con GPT-4: en torno a un 25 % más rápidos y mayor calidad dentro de la frontera, peores resultados en una tarea diseñada fuera de ella. https://www.hbs.edu/faculty/Pages/item.aspx?num=64700
Peng, S. et al. — The Impact of AI on Developer Productivity. Evidence from GitHub Copilot, arXiv:2302.06590 (2023). Experimento controlado: el grupo con Copilot terminó un 55,8 % más rápido. Sin medición de calidad de código a largo plazo. https://arxiv.org/abs/2302.06590
GitClear — Coding on Copilot (2024) y AI Copilot Code Quality (2025). Análisis de cientos de millones de líneas reales: aumento sostenido del churn respecto a la base previa a la IA, incremento de la duplicación de código y descenso de la refactorización por debajo del nivel de copia-pega. https://www.gitclear.com/ai_assistant_code_quality_2025_research
Apiiro — 4x Velocity, 10x Vulnerabilities. AI Coding Assistants Are Shipping More Risks (2025). Asocia el aumento del código generado con IA a un crecimiento de hallazgos de seguridad y de superficie de ataque. https://apiiro.com/blog/4x-velocity-10x-vulnerabilities-ai-coding-assistants-are-shipping-more-risks/
Goodhart, C. — Problems of Monetary Management. The U.K. Experience (1975). Origen de la idea conocida como ley de Goodhart.
Strathern, M. — «Improving Ratings». Audit in the British University System, European Review 5 (1997). Fuente de la formulación popular «cuando una medida se convierte en objetivo, deja de ser una buena medida».
OECD — Series de productividad laboral, Compendium of Productivity Indicators. https://www.oecd.org/sdd/productivity-stats/
Bureau of Labor Statistics (EE. UU.) y Eurostat — Series oficiales de productividad sectorial.
Para profundizar
Coyle, D. — GDP. A Brief But Affectionate History (Princeton University Press, 2014). Historia crítica del indicador.
Stiglitz, J., Sen, A. & Fitoussi, J.-P. — Mismeasuring Our Lives. Why GDP Doesn't Add Up (The New Press, 2010).
Brynjolfsson, E. & McAfee, A. — The Second Machine Age (W. W. Norton, 2014). Marco previo, lectura comparada con la literatura posterior.
También te interesa
- La eficiencia como trampa
- La ilusión de crecimiento
- El valor del trabajo intelectual
- Qué significa saber algo hoy

Comentarios0
Todavía no hay comentarios.
Deja un comentario