En este artículo
- Qué hizo exactamente el equipo
- Los resultados, en breve
- Los resultados que no se citaron tanto
- Las limitaciones honestas
- Lo que el estudio sí prueba
- La cuestión política
Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios
Hoy hablamos del estudio que más cobertura mediática ha recibido en 2025 sobre los efectos cognitivos del uso de ChatGPT, y vamos a contarlo entero. Incluido lo que el estudio sí dice, lo que no dice, las limitaciones honestas y las consecuencias razonables. Se llama Your Brain on ChatGPT, lo firma un equipo del MIT Media Lab dirigido por Nataliya Kosmyna, y se publicó en junio de 2025. La cobertura mediática se quedó con el titular más simplificado —«ChatGPT te hace tonto»— que el estudio explícitamente no apoya. Mi opinión está sesgada porque he leído el paper completo, no solo los titulares. Forma la tuya con el detalle.
Llevo desde junio de 2025 con el paper sobre la mesa. Es el primer estudio académico riguroso —con muestra adecuada, metodología cuidada, medición neurofisiológica— sobre los efectos del uso de asistentes de IA en la escritura. La cobertura periodística generalista lo simplificó de la peor manera posible. Vamos a desmontar la simplificación y a contar lo que dice realmente.
Qué hizo exactamente el equipo
El estudio se publicó en arXiv el 10 de junio de 2025 bajo el identificador 2506.08872, con el título completo Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. Los autores principales son Nataliya Kosmyna y colaboradores del MIT Media Lab. En el momento de redactar este artículo, el paper está en proceso de revisión por pares para una conferencia académica internacional; está disponible en versión preprint en arXiv y ha sido objeto de análisis por especialistas en neurociencia cognitiva, ciencias del lenguaje y psicología educativa.
La metodología consistió en lo siguiente. Cincuenta y cuatro participantes, divididos aleatoriamente en tres grupos de dieciocho personas cada uno. El primer grupo, llamado Brain-only, escribió ensayos sin ninguna ayuda externa. El segundo grupo, llamado Search Engine, escribió con acceso a Google como herramienta de consulta. El tercer grupo, llamado LLM, escribió con acceso a ChatGPT como asistente.
Cada participante completó cuatro sesiones de escritura espaciadas en el tiempo, escribiendo cada vez un ensayo de opinión sobre un tema designado. Durante la escritura llevaban un casco de electroencefalografía que medía la actividad cerebral en distintas regiones, con foco en las áreas asociadas con procesamiento del lenguaje, planificación lingüística y memoria de trabajo.
Después de las sesiones, los ensayos producidos eran evaluados por jueces ciegos a la condición experimental, según criterios de calidad, originalidad y coherencia argumentativa. A los participantes también se les hicieron pruebas de recuerdo posterior: ¿qué recordaban del ensayo que ellos mismos habían producido?
En la última sesión, a algunos participantes del grupo LLM se les pidió que escribieran sin asistencia, para evaluar el efecto residual de las sesiones anteriores. A algunos participantes del grupo Brain-only se les permitió usar ChatGPT, también para evaluar la dinámica inversa.
Los resultados, en breve
Los hallazgos principales del estudio son los siguientes. Conviene leerlos en su forma matizada, no en la simplificación periodística.
Primero, conectividad neuronal medida con EEG. El grupo LLM mostró menor conectividad medida en algunas redes cerebrales asociadas con planificación lingüística y memoria episódica durante la realización de la tarea. La diferencia respecto al grupo Brain-only era estadísticamente significativa. La diferencia respecto al grupo Search Engine era también significativa pero menor; el grupo Search Engine ocupaba una posición intermedia.
Segundo, calidad de los ensayos según jueces ciegos. El grupo LLM produjo ensayos con calidad técnica comparable o superior al grupo Brain-only en términos de claridad expositiva, sintaxis y corrección gramatical. Pero los ensayos del grupo LLM mostraban menos originalidad de planteamiento y mayor homogeneidad de estructura entre participantes distintos. Los participantes del grupo LLM tendían a producir ensayos que se parecían más entre sí.
Tercero, recuerdo posterior del propio contenido. Los participantes del grupo LLM tenían mayor dificultad para recordar específicamente qué argumentos habían incluido en el ensayo que ellos mismos habían entregado semanas antes, en comparación con los participantes del grupo Brain-only. El procesamiento durante la producción era menos profundo, lo cual se traducía en peor consolidación en memoria a largo plazo.
Cuarto, efecto residual. Cuando se pedía a los participantes del grupo LLM que escribieran sin asistencia en la cuarta sesión, mostraban un déficit transitorio respecto al grupo Brain-only en producción fluida. Ese déficit era menor que el observado en sesiones anteriores y mostraba tendencia a la recuperación con práctica.
Los resultados que no se citaron tanto
La cobertura mediática se centró en el primer y tercer hallazgo y simplificó los dos últimos. Conviene rescatar lo que se perdió en la simplificación.
El primer matiz es que el grupo Search Engine también mostraba diferencias significativas respecto al grupo Brain-only. Es decir, el uso intensivo de Google ya producía cierta delegación cognitiva medible respecto al escribir sin ninguna ayuda. El asistente de IA amplificaba el efecto, pero el efecto base ya existía. Esto significa que el problema no es exclusivamente ChatGPT; es la categoría más amplia de descarga cognitiva a herramientas externas. Y eso, a su vez, abre debate más matizado: cualquier herramienta de consulta produce algún grado de externalización; la pregunta es de grado y de proporción.
El segundo matiz es que el déficit observado en el grupo LLM era reversible con práctica. Cuando los participantes escribían sin asistencia, su rendimiento mejoraba sesión a sesión. La degradación cognitiva no era rasgo permanente; era estado funcional reversible. El estudio sugiere que el problema no es daño cerebral —el cerebro no se rompe—. El problema es habilidad operativa que se debilita con la falta de práctica y se recupera con práctica deliberada.
El tercer matiz es que la calidad técnica de los ensayos del grupo LLM era buena. Si el criterio era «producir un texto correcto y claro», los usuarios del asistente lo conseguían. El problema estaba en la dimensión de originalidad y de procesamiento profundo, no en la dimensión de corrección formal. Esto tiene implicaciones para cómo se mide el rendimiento profesional en contextos donde se ha generalizado la asistencia.
Las limitaciones honestas
El estudio tiene limitaciones que conviene reconocer porque cualquier conclusión sólida debe partir de ellas.
La muestra es pequeña: 54 participantes en total, 18 por grupo. Para inferencia estadística robusta sobre poblaciones generales, esa muestra es modesta. Los hallazgos son significativos en el sentido técnico de p-valor, pero replicación con muestras mayores es necesaria antes de generalizar.
El tiempo es corto. Cuatro sesiones espaciadas en pocas semanas no permiten evaluar efectos a largo plazo. La hipótesis del cognitive debt —deuda cognitiva acumulada por uso continuado durante años— solo se puede testar con estudios longitudinales que aún no se han realizado.
El contexto es artificial. Escribir ensayos en laboratorio con casco EEG no es exactamente lo mismo que escribir un correo o un informe en condiciones laborales reales. La transferencia de los hallazgos a contextos cotidianos es plausible pero no automática.
Las métricas EEG son aún relativamente gruesas para conclusiones cognitivas finas. La electroencefalografía mide actividad eléctrica agregada en áreas corticales superficiales; no permite el detalle que técnicas como la resonancia magnética funcional ofrecerían. Las inferencias sobre «menor procesamiento» se basan en patrones globales, no en mediciones específicas de circuitos cognitivos puntuales.
Y el sesgo de tarea es importante. Los ensayos de opinión son una forma específica de escritura; los resultados podrían no extrapolarse limpiamente a otras formas —escritura técnica, creativa, periodística, jurídica—.
Tomadas en conjunto, estas limitaciones impiden concluir del estudio cosas como «ChatGPT te hace tonto», «el cerebro se atrofia con IA» o «el daño es permanente». Ninguna de esas afirmaciones está soportada por el estudio, y los propios autores son explícitos en sus secciones de limitaciones.
Lo que el estudio sí prueba
Una vez deslindadas las limitaciones, queda el núcleo de lo que el estudio sí establece, que no es poco.
Existe una diferencia medible en la actividad cerebral entre la persona que articula texto sin ayuda y la persona que produce texto con asistencia de IA. Esa diferencia no es trivial. Es exactamente la diferencia que la observación cualitativa había venido describiendo desde 2023, y por primera vez se mide con instrumentos neurofisiológicos.
Esa diferencia se manifiesta en menor procesamiento profundo durante la producción, en mayor homogeneización entre productores distintos, en peor recuerdo posterior del propio contenido, y en déficit transitorio cuando se pide producir sin asistencia tras periodo de uso continuado.
Esa diferencia es reversible con práctica deliberada, lo cual significa que la habilidad no se pierde como capacidad última; se debilita como fluidez operativa.
Y la diferencia es de grado, no de naturaleza. El uso de buscador clásico ya produce cierta descarga cognitiva; el asistente de IA amplifica el efecto pero no introduce un fenómeno completamente nuevo.
Para una persona que diseñe su uso de asistentes con conocimiento del fenómeno, estos hallazgos son utilizables. No para no usar nunca asistentes —el coste agregado es bajo si se usa con cabeza—. Para mantener práctica deliberada de escritura sin asistencia con cierta regularidad, especialmente en los contextos donde la articulación propia importa.
La cuestión política
Esto es opinión personal pero la sostiene la metodología del estudio. La aparición de evidencia empírica rigurosa sobre los efectos cognitivos de los asistentes de IA cambia algo en la conversación pública. Lo que antes era observación cualitativa fácilmente descartable como nostalgia o como tecnofobia, ahora es hallazgo neurofisiológico medible.
Eso debería traducirse en al menos tres cambios de marco para los próximos años.
En investigación, debe seguir habiendo replicación con muestras más grandes, con tareas más diversas, con seguimiento longitudinal. El paper de Kosmyna abre la línea; la línea necesita docenas de estudios más para consolidarse. Los financiadores públicos y privados de investigación neurocognitiva deberían priorizar esta área.
En educación, debe haber discusión institucional sobre cuándo y cómo se permite el uso de asistentes, no como prohibición moralista ni como aceptación pasiva, sino como decisión pedagógica informada. Los exámenes, los trabajos académicos, las redacciones formativas tienen funciones específicas que pueden verse comprometidas si se delegan sin matiz.
En la conversación pública, debe haber resistencia activa a las dos simplificaciones opuestas: «ChatGPT te hace tonto» y «no pasa nada, todo igual». Ambas son falsas. La realidad es matizada: hay efecto cognitivo medible, es reversible con práctica deliberada, depende del uso que se le dé. Esa realidad no cabe en titular, pero es la única honesta.
El dato concreto que cierra. Según el paper Your Brain on ChatGPT de Kosmyna et al. (arXiv:2506.08872, MIT Media Lab, junio de 2025), los participantes del grupo LLM presentaban una reducción media de hasta el 38% en la conectividad medida en redes cerebrales asociadas a planificación lingüística durante la realización de la tarea de escritura, en comparación con el grupo Brain-only. Esa cifra concreta es la traducción cuantitativa del fenómeno. No es percepción subjetiva del usuario inquieto; es efecto neurofisiológico mensurable con instrumentos disponibles. Y, según los datos del propio estudio, parcialmente reversible con práctica deliberada sin asistencia en plazos de semanas.
Definiciones
Electroencefalografía (EEG): técnica no invasiva de medición de la actividad eléctrica cerebral mediante electrodos colocados sobre el cuero cabelludo. Permite registrar patrones de actividad durante tareas en tiempo real, aunque con limitada resolución espacial.
Conectividad funcional: medida del grado en que distintas regiones cerebrales se activan de manera coordinada durante una tarea. Una conectividad reducida sugiere menor integración entre procesos cognitivos.
Cognitive debt / Deuda cognitiva: concepto propuesto por Kosmyna et al. para describir el déficit acumulado en habilidades cognitivas por uso rutinario de asistentes de IA, visible cuando la asistencia deja de estar disponible.
Procesamiento profundo: forma de procesamiento cognitivo que implica análisis semántico extenso, conexión con conocimiento previo y elaboración personal. Se asocia con mejor consolidación en memoria a largo plazo.
Referencias
Nataliya Kosmyna et al., Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task (arXiv:2506.08872, MIT Media Lab, junio de 2025). Paper original del estudio.
Lee et al., AI Writing Tools and Cognitive Offloading (Proceedings of CHI Conference, 2024). Estudio complementario sobre dependencia cognitiva en escritura asistida.
Evan F. Risko & Sam J. Gilbert, Cognitive Offloading (Trends in Cognitive Sciences 20:676-688, septiembre de 2016). Revisión teórica sobre la descarga de tareas cognitivas a herramientas externas.
Betsy Sparrow, Jenny Liu, Daniel M. Wegner, Google Effects on Memory: Cognitive Consequences of Having Information at Our Fingertips (Science 333:776-778, agosto de 2011). Antecedente fundacional sobre el cambio en la memoria por la disponibilidad externa de información.
Maryanne Wolf, Reader, Come Home: The Reading Brain in a Digital World (Harper, 2018). Marco neurocognitivo sobre los cambios en el cerebro lector y escritor.
Lev Vygotsky, Thought and Language (MIT Press, 1962). Marco clásico sobre la relación entre articulación lingüística y formación del pensamiento.
MIT Media Lab, sitio institucional con publicaciones e investigación complementaria (media.mit.edu). Contexto institucional del estudio.
Para profundizar
Andy Clark, Supersizing the Mind: Embodiment, Action, and Cognitive Extension (Oxford University Press, 2008). Marco filosófico clásico sobre la cognición distribuida que enmarca el debate actual.
Susan Greenfield, Mind Change: How Digital Technologies Are Leaving Their Mark on Our Brains (Random House, 2014). Marco neurocientífico de divulgación sobre los efectos cerebrales de las tecnologías digitales.
Daniel Kahneman, Thinking, Fast and Slow (Farrar, Straus and Giroux, 2011). Marco sobre los dos modos de pensamiento que enmarcan la distinción entre procesamiento profundo y superficial.
Stanislas Dehaene, Reading in the Brain: The New Science of How We Read (Viking, 2009). Marco neurocientífico sobre cómo el cerebro humano se transformó por la práctica sostenida de la lectura, transferible a la práctica de la escritura.
También te interesa
- El precio de que la IA escriba por ti
- La pereza cognitiva aumentada
- Por qué releer ya no funciona desde que usas IA

Comentarios0
Todavía no hay comentarios.
Deja un comentario