En este artículo
- La habitación, en serio
- Bender y Koller. El pulpo que aprende inglés por accidente
- La respuesta funcionalista, y por qué no termina de cerrar el debate
- La paradoja pragmática
- La sospecha sobre nuestro propio pensar
- Capacidades emergentes y otras palabras gastadas
- Lo que el debate no cerrado deja en la mano
Definiciones · Referencias · También te interesa · En otros sitios
Searle propuso en 1980 una habitación en la que un hombre manipula símbolos chinos sin saber chino y produce respuestas indistinguibles de las de un hablante nativo. Cuarenta y seis años después, los LLM hacen exactamente eso a escala industrial. Procesar no es comprender, al menos según cualquier definición útil del verbo entender. Lo incómodo del asunto no es la habitación. Lo incómodo es que si funciona igual, hay que preguntarse qué pensábamos que era pensar antes de que la habitación se construyera de verdad y se vendiera por subscripción.
La habitación, en serio
Conviene refrescar el experimento mental porque casi todo el mundo lo cita de memoria y casi nadie de primera mano. John Searle, en Minds, Brains, and Programs (Behavioral and Brain Sciences 3, 1980, pp. 417–457), pidió que imagináramos a un hombre encerrado en una habitación. Le pasan por una ranura papeles con símbolos chinos. Él, que no sabe chino, dispone de un manual, también escrito en su lengua, que le indica con qué símbolos chinos responder ante qué combinaciones de símbolos chinos entrantes. Sigue el manual, compone respuestas, las devuelve por la ranura.
Fuera de la habitación, un hablante de chino lee las respuestas y las encuentra perfectas. Sostiene una conversación con el hombre de dentro y queda convencido de estar hablando con un nativo. El hombre de dentro no ha entendido una sola palabra. Ha movido símbolos según un libro, y las salidas han sido correctas.
El argumento de Searle era directo. La sintaxis no produce semántica. Por mucho que un sistema manipule símbolos siguiendo reglas, eso no constituye comprensión, y por tanto la inteligencia artificial fuerte, la que sostiene que un programa adecuado sería una mente, queda refutada. El experimento atacaba al funcionalismo de su época, no a los LLM, que no existían. Cuarenta y seis años después la situación es incómoda. Lo que era un experimento mental se ha convertido en un producto comercial. Y la pregunta de Searle no se ha respondido. Se ha desplazado.
Bender y Koller. El pulpo que aprende inglés por accidente
En 2020, en Climbing towards NLU. On Meaning, Form, and Understanding in the Age of Data (ACL 2020), Emily Bender y Alexander Koller actualizaron el argumento con una metáfora que conviene tener fresca. Imagine, dicen, un pulpo hiperinteligente en el fondo del mar, conectado a un cable submarino de telégrafo. Por ese cable circulan conversaciones entre dos personas en una isla. El pulpo, sin acceso al mundo de la isla, sin ver una palmera, sin tocar un coco, escucha durante años. Aprende a predecir qué patrones siguen a qué patrones. Llegado el momento, intercepta el cable y empieza a responder en lugar de uno de los interlocutores. Funciona, durante un tiempo, porque ha aprendido la forma. Hasta que el interlocutor pregunta algo concreto sobre cómo construir una catapulta con palmeras: ahí el pulpo, que nunca ha visto una palmera, falla en silencio.
Bender y Koller lo formalizan así. Un sistema entrenado únicamente sobre forma lingüística, sin acceso al referente externo de lo que se dice, no puede aprender significado en sentido estricto. Puede aprender distribuciones estadísticas de cómo se encadenan las palabras, lo cual es suficiente para sostener buena parte de una conversación. No es suficiente para garantizar que el sistema sepa de qué habla.
El argumento del pulpo es la versión técnica y actualizada de la habitación china. Es más útil que la habitación porque no depende de intuiciones metafísicas sobre qué cuenta como «mente». Solo dice que hay una distinción operativa entre forma y significado, que los LLM están del lado de la forma, y que confundir una cosa con la otra tiene consecuencias prácticas.
La respuesta funcionalista, y por qué no termina de cerrar el debate
Hay una salida clásica al argumento de Searle, defendida con vigor por Daniel Dennett en Consciousness Explained (Little, Brown, 1991) y, con otras herramientas, por Douglas Hofstadter en Gödel, Escher, Bach (Basic Books, 1979). Se llama funcionalismo. Dice más o menos esto: si dos sistemas producen exactamente la misma conducta observable ante el mismo conjunto de estímulos, son cognitivamente equivalentes. Lo que importa es la función, no el sustrato. Da igual si dentro hay neuronas, transistores o un hombre con un manual. Si hace lo mismo, es lo mismo.
La posición tiene su elegancia y resuelve algunos atascos. Si rechazamos el funcionalismo de manera estricta, terminamos defendiendo que solo cierto material biológico puede sostener mente, lo cual no es una idea cómoda de defender salvo por argumentos de fe. Pero el funcionalismo paga su elegancia con un precio que el debate ha ido descubriendo poco a poco. Si la equivalencia funcional completa exige que los dos sistemas se comporten igual en todas las situaciones posibles, los LLM no la cumplen. Fallan fuera de su distribución de entrenamiento, alucinan, contradicen razonamientos que ellos mismos acababan de sostener. La equivalencia es local, no global. Si se exige solo equivalencia práctica en un rango acotado, entonces la palabra «equivalencia» se vacía.
Gary Marcus ha hecho del señalamiento de estas grietas su trabajo de los últimos años. En entradas como A Knockout Blow for LLMs? en Marcus on AI y en su columna en Communications of the ACM, insiste en que los modelos de razonamiento más recientes siguen colapsando en problemas estructurados ligeramente fuera de distribución, y que sin una representación explícita de hechos no hay solución de principio a la alucinación. Se le puede aceptar o rechazar la conclusión optimista o pesimista. Lo que es difícil discutir es la observación. La equivalencia funcional, en los LLM, es parcial y depende del recorte.
La paradoja pragmática
Aquí aparece la pregunta incómoda que el debate filosófico clásico no contempla, porque en 1980 no era una pregunta práctica. ¿Y si no importa que el sistema entienda, mientras acierte?
Si una empresa contrata a un asistente para responder consultas de clientes, lo que mide al final del trimestre es la tasa de resolución, no la profundidad de la comprensión del asistente. Si un médico de urgencias usa un sistema para apoyar diagnósticos, lo que cuenta es si el sistema acierta más que el médico solo. Si un programador delega tareas en un LLM, lo que importa es si el código funciona y los tests pasan. En todos esos contextos, acertar es lo único operativo. La comprensión es un concepto que el contrato no firma.
La paradoja consiste en lo siguiente. Si en suficientes contextos la diferencia entre comprender y acertar no se nota, entonces el concepto de comprensión pierde tracción en la vida pública. No deja de existir filosóficamente, pero deja de ser exigible, deja de ser auditable, deja de ser una palanca decisional. Y cuando un concepto pierde tracción, la persona que tenía la información asimétrica gana. La industria sabe que sus sistemas no comprenden; el usuario asume que comprenden; la vida intermedia procede como si la asimetría no existiera, hasta que se cae.
La sospecha sobre nuestro propio pensar
Hay una segunda lectura, más sutil. Si funciona igual y no importa, no es solo el concepto de comprensión el que se desploma. Es nuestra propia comprensión la que entra en sospecha. Quizá lo que llamábamos pensar en humanos también era, en porcentaje mayor del que admitíamos, manipulación de patrones aprendidos. Quizá la inteligencia humana está más cerca del pulpo de Bender y Koller que de la imagen idealizada que nos hacemos de ella. La pregunta, entonces, no es solo qué hacen los LLM. Es qué pensábamos que hacíamos nosotros antes de que los LLM lo hicieran a escala.
Esta lectura es la que más incomoda, y la que peor se admite en cualquier conversación pública sobre IA. Aceptarla parcialmente no obliga a aceptar el funcionalismo. Solo obliga a aceptar que la diferencia entre comprender y simular comprender es más fina de lo que el sentido común creía, y que parte de la operación cognitiva humana cae del lado de la simulación más a menudo de lo que nos gusta reconocer.
Capacidades emergentes y otras palabras gastadas
En 2022 aparecieron los primeros papers sobre capacidades emergentes de los LLM. Conforme los modelos crecían, ciertas tareas pasaban de fracaso completo a resolución competente sin pasos intermedios. Aritmética modular, traducción de idiomas raros, razonamientos multi-paso. La palabra «emergencia» evocaba un salto cualitativo y se filtró rápido al discurso comercial.
La literatura posterior ha enfriado mucho la imagen. Searle volvió sobre el asunto en The Rediscovery of the Mind (1992) para precisar lo que su argumento original sí decía y lo que no, contra una década de paráfrasis perezosas; Bender, Gebru, McMillan-Major y Shmitchell, en On the Dangers of Stochastic Parrots (2021), extendieron el problema al uso elástico de vocabulario cognitivo aplicado a sistemas que no tienen nada del sustrato al que la palabra remite. Berti y otros, en Emergent Abilities in Large Language Models. A Survey (arXiv 2503.05788, 2025), repasan el campo y muestran que buena parte de los saltos «emergentes» son artefactos de la métrica elegida: si usas precisión sobre tarea binaria, ves saltos; si usas verosimilitud continua, ves crecimiento suave. La emergencia, en muchos casos, no es del modelo: es del medidor que usamos para verlo. Eso no quita que existan transiciones reales en algunos casos. Quita la idea de que el modelo «entiende cuando alcanza cierta escala», porque la entrada de un humano que oye «emergente» es exactamente esa.
La cadena de retórica funciona. Salto emergente → comprensión → razonamiento → conciencia. Cada eslabón es un acortamiento aceptable solo si el anterior lo es. Romper el primero, mostrar que los saltos son artefactos métricos, rompe la cadena entera. Pero la cadena rota sigue circulando en kits de prensa, porque el lector no lee la corrección publicada un año después.
Lo que el debate no cerrado deja en la mano
Si la habitación china no se ha respondido en cuarenta y seis años y los LLM la han llevado al mundo real, lo razonable es preguntarse qué se hace en la práctica con un debate que no se cierra. La respuesta operativa, lo veamos o no, ya está dada. Las decisiones de adopción se toman a favor de la lectura más permisiva del concepto de comprensión. Los reguladores aceptan métricas conductuales. Los inversores valoran capacidades demostradas. Los usuarios delegan confiando en una operación cuyo estatus epistemológico sigue abierto.
La ambigüedad no es neutral. Cuando un concepto no está cerrado, lo explota el actor con más capacidad de marcar narrativa, y en este caso ese actor es la industria. Llamar comprensión a lo que los modelos hacen es legal, es defendible filosóficamente bajo posiciones funcionalistas, y es comercialmente útil. La parte que se calla, sistemáticamente, es la cláusula que los académicos serios añaden a su versión del término: «comprensión en el sentido funcional restringido a esta tarea». La cláusula desaparece cuando el concepto cruza al kit de prensa, y lo que queda es una palabra mayor sin matiz.
Searle escribió en 1980 que un programa no era una mente. Bender y Koller en 2020 escribieron que un sistema entrenado solo en forma no aprendía significado. Los dos enunciados son compatibles, son verificables empíricamente al menos en su versión débil, y los dos siguen incomodando porque obligan a admitir que la mayor parte de lo que la industria llama comprensión es otra cosa. Si esa otra cosa basta para acertar, magnífico. Pero conviene saber que es otra cosa antes de delegar lo que solo la comprensión permite delegar.
Definiciones
Habitación china. Experimento mental propuesto por John Searle en 1980 para argumentar que la manipulación de símbolos según reglas, por correcta que sea la salida, no constituye comprensión. Un hombre encerrado responde en chino siguiendo un manual sin saber chino.
IA fuerte / IA débil. Distinción introducida por Searle. La IA fuerte sostiene que un programa adecuado sería una mente con estados mentales reales. La IA débil sostiene que un programa puede simular funcionalmente una mente sin tener estados mentales. Searle rechazaba la primera.
Funcionalismo. Posición filosófica según la cual lo que define un estado mental es su rol funcional, no el sustrato físico que lo realiza. Dennett es uno de sus defensores contemporáneos. Implica que sistemas distintos con funciones equivalentes son mentalmente equivalentes.
Forma vs significado. Distinción central de Bender y Koller (2020). La forma es la distribución estadística de las expresiones lingüísticas; el significado depende de su anclaje en referentes del mundo. Un sistema entrenado solo en forma no aprende significado.
Octopus test. Metáfora de Bender y Koller del pulpo que aprende a predecir patrones lingüísticos sin tener acceso al mundo de los hablantes. Versión moderna y operativa de la habitación china.
Capacidad emergente. Habilidad que un modelo de lenguaje exhibe a partir de cierto tamaño y que no estaba presente en modelos menores. La literatura reciente sugiere que buena parte de las emergencias documentadas son artefactos de las métricas usadas, no transiciones reales del modelo.
Referencias
Searle, J. R. (1980). Minds, Brains, and Programs. Behavioral and Brain Sciences 3, 417–457. Origen del experimento mental de la habitación china y del argumento contra la IA fuerte.
Searle, J. R. (1992). The Rediscovery of the Mind. MIT Press. Reformulación posterior del argumento, citada para precisar el alcance del rechazo a la IA fuerte.
Bender, E. M. & Koller, A. (2020). Climbing towards NLU. On Meaning, Form, and Understanding in the Age of Data. ACL 2020. Origen del «octopus test» y de la distinción operativa entre forma y significado en sistemas de lenguaje.
Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Extiende el argumento sobre el uso elástico de vocabulario cognitivo aplicado a LLM.
Dennett, D. (1991). Consciousness Explained. Little, Brown. Posición funcionalista contemporánea, citada como contrapunto al rechazo de Searle.
Hofstadter, D. (1979). Gödel, Escher, Bach. An Eternal Golden Braid. Basic Books. Defensa amplia de la posibilidad de que la mente emerja de la manipulación recursiva de patrones formales.
Berti, L., Giorgi, F. & Kasneci, G. (2025). Emergent Abilities in Large Language Models. A Survey. arXiv 2503.05788. Revisión crítica de la noción de capacidades emergentes; muchos saltos son artefactos métricos.
Marcus, G. Marcus on AI. Substack y Communications of the ACM. Crítica continuada al uso de términos cognitivos en sistemas que fallan fuera de distribución.
También te interesa
- La estadística como sustituto del conocimiento
- Máquinas que parecen pensar
- Medir la inteligencia artificial
- Ironía y contexto. El ochenta por ciento del habla que se les escapa

Comentarios0
Todavía no hay comentarios.
Deja un comentario