La estadística como sustituto del conocimiento. La respuesta correcta sin nadie que sepa

En este artículo

  1. Lo que hace, despacio, un modelo cuando habla
  2. Conocimiento, recordemos qué era
  3. Frankfurt y el bullshit, antes de la palabra de moda
  4. Tres figuras frente a la verdad
  5. Lo que hace visible la diferencia
  6. Especialización y rareza
  7. Cuando se inventa
  8. La epistemología asimétrica
  9. La consecuencia operativa
  10. La responsabilidad que no aparece

Definiciones · Referencias · También te interesa · En otros sitios

Una IA no sabe nada. Calcula la palabra siguiente con mayor probabilidad. Que la respuesta sea correcta no implica conocimiento detrás, implica que el cálculo dio la palabra adecuada en ese contexto. Harry Frankfurt llamó a esto «bullshit» en 2005, mucho antes de que la palabra se aplicara a la IA: discurso indiferente a la verdad, ni mentiroso ni veraz. La diferencia con un humano que sabe es invisible mientras todo va bien. Se hace visible solo cuando falla, y para entonces ya has tomado la decisión.

Lo que hace, despacio, un modelo cuando habla

Conviene tener clara la operación, porque la mayoría de los argumentos siguientes dependen de no perderla. Un LLM produce texto un token cada vez. Para cada token, calcula sobre el vocabulario entero una distribución de probabilidad condicionada por todo lo que ha visto hasta ese punto, dentro de su ventana de contexto. Esa distribución asigna a cada palabra posible un número entre cero y uno, y luego un mecanismo de muestreo, con o sin temperatura, elige una. Repite la operación con la salida concatenada. Repite. Repite. Hasta que el sistema decide cortar.

No hay, en ese proceso, una representación interna del hecho de que algo sea verdad. Hay frecuencias, hay patrones, hay vecindades en un espacio de embeddings. Las frecuencias se han calibrado durante el entrenamiento sobre billones de tokens, y han producido una distribución muy fina que, en muchísimos contextos, predice como token más probable la palabra que un humano informado también escribiría. Pero el mecanismo no es saber. Es estimar lo siguiente.

La distinción no es retórica. Tiene una consecuencia muy concreta: cuando la mediana del corpus se equivoca en un punto, el modelo se equivoca con ella, y lo hace con exactamente la misma fluidez con la que acierta cuando la mediana acertaba.

Conocimiento, recordemos qué era

Hay una definición clásica que arrastramos desde Platón. Conocimiento es creencia verdadera justificada. Una proposición se sabe si se cree, si es cierta y si la creencia tiene una justificación adecuada. La definición resistió siglos. En 1963, en un texto breve de tres páginas, Edmund Gettier la rompió con un par de contraejemplos en Is Justified True Belief Knowledge? (Analysis 23(6)). Mostró que se puede tener creencia verdadera justificada y aun así, intuitivamente, no estar sabiendo. Sus contraejemplos abrieron un debate que sigue abierto sesenta y tres años después, con docenas de reparaciones propuestas y ninguna definitiva.

Lo interesante para la pregunta sobre LLM no es la disputa entre los herederos de Gettier. Es que, sea cual sea la reparación que uno acepte, todas las versiones serias del concepto de conocimiento requieren al menos dos cosas que un LLM no tiene. Primero, un sujeto que sostenga la creencia, con algo que se parezca a una representación interna del hecho. Segundo, una justificación que conecte esa creencia con el mundo, no solo con el corpus.

Un LLM no cree. Lo que produce no es una creencia suya, es un token muestreado de una distribución condicionada. Y la justificación, en sentido epistemológico, está ausente. El modelo no puede explicar por qué afirma lo que afirma, salvo en términos de coocurrencia estadística con el contexto. Cuando se le pide que «justifique», produce más texto que parece justificación, generado por el mismo mecanismo: la palabra más probable dado el contexto. Es justificación sintética, no anclada en hechos.

Decir que un LLM sabe algo es, por tanto, una manera elástica de hablar. Lo que el sistema tiene es disponibilidad estadística. La diferencia es invisible en una conversación de bar, donde la disponibilidad estadística basta para parecer informado. Es decisiva en cualquier dominio donde la confianza dependa de la cadena causal entre lo dicho y lo que ocurre fuera.

Frankfurt y el bullshit, antes de la palabra de moda

Harry Frankfurt publicó en 1986 un ensayo en Raritan, ampliado en libro en 2005 bajo el título On Bullshit (Princeton University Press). Es un texto breve, denso, técnico en el sentido filosófico de la palabra. Su tesis central distingue tres figuras.

El mentiroso conoce la verdad y la oculta deliberadamente. Tiene una relación intensa con la verdad: la respeta lo suficiente para esconderse de ella. El veraz cree lo que dice y se esfuerza por que sea cierto. El bullshitter no es ninguno de los dos. Es alguien indiferente a la verdad. No le importa si lo que dice es cierto o falso. Lo que le importa es el efecto del discurso: convencer, sostener una conversación, parecer competente, vender algo. La verdad y la falsedad no son sus criterios. Su criterio es la eficacia retórica.

Tres figuras frente a la verdad

Frankfurt remataba el ensayo con una observación incómoda: el bullshit es más peligroso para la verdad que la mentira directa. Porque el mentiroso al menos tiene un mapa de qué es cierto y qué no, mientras que el bullshitter ha desactivado la pregunta. Y porque la cultura del bullshit, cuando se generaliza, erosiona la capacidad colectiva de distinguir lo verdadero de lo falso.

La aplicación a los LLM es directa, y se le ha visto venir desde hace años. En 2024 apareció incluso un paper titulado ChatGPT is Bullshit (Hicks, Humphries y Slater, en Ethics and Information Technology), que sostiene la equivalencia con argumentos formales. Lo que hace un LLM no es mentir. Tampoco es decir la verdad. Es generar el texto estadísticamente más adecuado al contexto. Si ese texto coincide con la verdad, perfecto. Si no, perfecto igual. El mecanismo es indiferente a la pregunta. Es bullshit en el sentido técnico de Frankfurt, sin connotación moral, descriptivamente.

Decirlo así no implica que los LLM no sean útiles. Implica que su utilidad no debería confundirse con su veracidad.

Lo que hace visible la diferencia

Cuando todo va bien, la diferencia entre conocimiento y disponibilidad estadística es indetectable. Si preguntas la capital de Francia, da igual cómo lo «sabe» el sistema. La capital es París, la salida es París, el resultado es satisfactorio.

La diferencia se hace visible en cuatro escenarios típicos.

El primero es el dominio especializado. Cuando una pregunta exige conocimiento de nicho, el modelo tiene menos masa estadística sobre la que entrenar. Las respuestas se vuelven más fluidas en la forma y más inestables en el contenido. En medicina rara, en derecho de jurisdicciones pequeñas, en historia regional menor, el LLM produce respuestas que suenan bien y que un profesional del campo identifica como compuestas. Compuestas en el sentido de que mezclan elementos plausibles, pero no responden a una verdad concreta verificable.

Especialización y rareza

El segundo es el contexto inusual. Preguntas donde la combinación de variables se aparta de la distribución habitual del corpus. El modelo extrapola por similaridad, y las salidas son las que produciría alguien que conoce el género de la respuesta sin conocer la respuesta concreta. Cuando se le insiste, el modelo no rectifica con un «no lo sé»; rectifica con otra producción del mismo género, igualmente fluida.

El tercero es la pregunta donde la mediana del corpus está equivocada. Si en internet hay diez fuentes que afirman una cosa y dos que afirman otra distinta, y resulta que las dos correctas son las que llegan tarde a la cobertura masiva, el modelo se inclinará hacia las diez. La verdad estadística del corpus puede divergir de la verdad. Cuando diverge, el modelo no se sitúa del lado de la segunda. Se sitúa del lado de la mayoría, con la misma confianza que cuando la mayoría tenía razón.

Cuando se inventa

El cuarto es la invención estadística (lo que la industria llama, sin matizar, alucinación; conviene mantener el matiz que se discutió en otro artículo de esta serie). Cuando el modelo carece de información en el corpus sobre una pregunta concreta y aun así produce una respuesta, no anuncia el déficit. Genera lo que estadísticamente parecería una respuesta de ese género, con detalles fabricados que tienen toda la textura de los reales. Nombres inventados de autores, títulos de papers que no existen, sentencias judiciales que nunca se dictaron. La invención es bullshit en estado puro: indiferencia a la verdad mantenida a flote por la maquinaria de fluidez.

En ninguno de estos cuatro escenarios el sistema avisa al usuario. La salida tiene el mismo formato, la misma fluidez, el mismo tono confidente que cuando acierta.

La epistemología asimétrica

Hay un punto que conviene subrayar porque a menudo se pasa por alto. Un humano que sabe puede equivocarse, y cuando lo hace, su error suele venir con marcadores reconocibles: titubeo, cambio de tono, autocrítica si tiene tiempo de pensarlo. Un humano que no sabe pero se atreve a contestar, también, normalmente, deja huellas. La cultura conversacional humana ha desarrollado señales finas para distinguir confianza informada de improvisación.

Un LLM no tiene esa modulación, salvo cuando ha sido entrenado explícitamente para simularla. Y cuando se le entrena para parecer humilde, lo es de manera uniforme, no condicionada a la calidad real de la respuesta. La calibración entre confianza y acierto está, en el mejor de los casos, parcial: el modelo es igual de seguro cuando acierta que cuando se equivoca, salvo intervenciones específicas que la industria todavía no ha generalizado.

La consecuencia es asimétrica. El usuario evalúa al modelo con los criterios con los que evaluaría a un humano. La fluidez se interpreta como dominio del tema. La ausencia de titubeo se interpreta como certeza fundada. La extensión de la respuesta se interpreta como profundidad. Esos tres marcadores, que en un humano correlacionan razonablemente con la cualidad de saber, en un LLM no correlacionan con nada. Son rasgos del estilo del modelo, no del contenido.

La consecuencia operativa

Cuando alguien delega en un LLM una tarea cuya correctitud importa, está confiando en la estadística del corpus, no en el conocimiento. Esta sustitución es invisible en la interfaz, está enmascarada por la fluidez, y no aparece en ninguna instrucción de uso del producto. El usuario no la ve y no tiene cómo verla salvo cuando algo falla espectacularmente y le obliga a abrir el capó.

La responsabilidad que no aparece

La distinción importa porque sostiene decisiones distintas. Confiar en el conocimiento de un experto humano admite responsabilidad: si se equivoca, hay quien rinde cuentas, hay un mecanismo de corrección, hay reputación en juego. Confiar en la estadística del corpus no admite ese tipo de responsabilidad. El corpus no se equivoca, simplemente refleja lo que había. El modelo no se equivoca, simplemente predice lo siguiente. Y la empresa proveedora, en sus términos de servicio, declina expresamente cualquier garantía sobre la corrección de las salidas. Lo dicen ellos por escrito, en letra que el usuario raramente lee.

Bender y otros, en On the Dangers of Stochastic Parrots (FAccT 2021), describían a los LLM como sistemas que generan secuencias plausibles de tokens sin acceso al significado. La metáfora del loro estocástico ha envejecido bien. Lo que hace un LLM al hablar es estadísticamente sofisticado, computacionalmente impresionante, y epistemológicamente indistinguible del bullshit de Frankfurt.

Bender y Koller, en Climbing towards NLU (ACL 2020), ya habían dejado el argumento conceptual: un sistema que aprende sobre forma sin acceso al significado no puede aspirar a comprender, solo a imitar. Marcus y Davis, en Rebooting AI (2019), recogieron antes la crítica al uso del vocabulario epistémico en sistemas que no tienen representación explícita de hechos. Hahn y Goyal en A Theory of Emergent In-Context Learning as Implicit Structure Induction (arXiv 2303.07971, 2023) ofrecen una lectura algo más amable. Sugieren que, sobre datos suficientemente composicionales, el modelo termina induciendo estructuras latentes que recombinan operaciones. Xie y otros, en An Explanation of In-context Learning as Implicit Bayesian Inference (ICLR 2022), llegan a una conclusión paralela: el ICL puede verse como una inferencia bayesiana sobre tareas latentes implícitas en el corpus. Las dos lecturas elevan el techo de lo que la estadística puede simular. Ninguna de las dos disuelve la diferencia entre simular el resultado de un razonamiento y haberlo razonado.

Y cuando la simulación basta, conviene tener nombre propio para lo que está pasando. El nombre, desde Frankfurt, ya existe.

Definiciones

Token. Unidad mínima de texto que un modelo procesa. Aproximadamente media palabra en inglés. Los LLM operan sobre secuencias de tokens, no sobre palabras ni sobre letras.

Predicción de token siguiente. Operación central de un LLM. Dada una secuencia de entrada, el modelo calcula sobre el vocabulario completo una distribución de probabilidad para el siguiente token, y muestrea uno. La operación se repite hasta cortar la generación.

Conocimiento (definición clásica). Creencia verdadera justificada. Definición platónica refinada hasta el siglo veinte, cuando Gettier la rompió con contraejemplos. Cualquier reparación seria sigue requiriendo sujeto, creencia y justificación, ninguno presente en sentido estricto en un LLM.

Caso de Gettier. Situación en la que alguien tiene una creencia verdadera y justificada y, sin embargo, intuitivamente no sabe. Mostró que la definición clásica de conocimiento era insuficiente y abrió la epistemología contemporánea.

Bullshit. Concepto técnico introducido por Harry Frankfurt en 1986 y formalizado en 2005. Discurso indiferente a la verdad, distinguible tanto de la mentira (que la oculta) como de la veracidad (que la persigue). Lo define la actitud del emisor hacia la pregunta de si lo dicho es cierto.

Loro estocástico. Metáfora popularizada por Bender, Gebru, McMillan-Major y Shmitchell (2021) para los LLM. Sistemas que generan secuencias plausibles de tokens sin acceso al significado de lo que producen.

Alucinación. Producción por parte de un LLM de información que parece factual pero es falsa: nombres inventados, citas inexistentes, datos fabricados. Es una expresión particularmente visible del carácter bullshit del mecanismo.

Calibración. Correspondencia entre la confianza con la que un sistema afirma algo y la probabilidad real de que sea cierto. En LLM, la calibración suele ser pobre: la fluidez no varía con el grado de respaldo factual.

Referencias

Frankfurt, H. G. (2005). On Bullshit. Princeton University Press. Ensayo original en Raritan (1986), ampliado en libro. Distinción operativa entre mentira y bullshit como categorías epistémicas distintas.

Gettier, E. L. (1963). Is Justified True Belief Knowledge?. Analysis 23(6), 121–123. Contraejemplos clásicos a la definición platónica de conocimiento, citados como prueba de que el concepto requiere más de lo que un LLM puede ofrecer.

Hicks, M. T., Humphries, J. & Slater, J. (2024). ChatGPT is bullshit. Ethics and Information Technology 26, 38. Aplicación formal del concepto de Frankfurt a los LLM, citada por su claridad argumentativa.

Bender, E. M. & Koller, A. (2020). Climbing towards NLU. On Meaning, Form, and Understanding in the Age of Data. ACL 2020. Distinción entre forma y significado en sistemas de lenguaje.

Bender, E., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. FAccT 2021. DOI: . Origen de la metáfora del loro estocástico.

Hahn, M. & Goyal, N. (2023). A Theory of Emergent In-Context Learning as Implicit Structure Induction. arXiv 2303.07971. Cota teórica que vincula predicción de token siguiente con inducción de estructura sobre datos composicionales.

Xie, S. M. et al. (2022). An Explanation of In-context Learning as Implicit Bayesian Inference. ICLR 2022. arXiv 2111.02080. Lectura del ICL como inferencia bayesiana sobre tareas latentes en el corpus.

Marcus, G. & Davis, E. (2019). Rebooting AI. Building Artificial Intelligence We Can Trust. Pantheon. Crítica anticipada al uso de vocabulario epistémico en sistemas sin representación explícita de hechos.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario