Verdad probabilística. La escuela enseña respuesta correcta, el mundo pide grado de confianza

En este artículo

  1. El examen como modelo del conocimiento
  2. Un torneo que midió quién acierta
  3. Por qué no llega al aula
  4. La máquina que afirma sin saber
  5. Lo que se decide en la cabina de voto

Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios

Me educaron para encontrar la respuesta. Una sola, marcada con bolígrafo rojo si fallaba. Tardé años en darme cuenta de que casi ninguna decisión adulta que importa tiene esa forma: el médico no sabe si es cáncer, estima; el analista no sabe si habrá recesión, pondera. La IA generativa llega disfrazada de oráculo y agrava el malentendido, porque no devuelve verdad sino una apuesta bien calibrada vestida de afirmación segura. Quien fue entrenado para leer en binario la recibe como certeza; quien aprendió a pensar en grados la recibe como hipótesis a contrastar. Y pensar en grados se entrena, aunque la escuela rara vez lo intente.

El examen como modelo del conocimiento

Recuerdo el formato antes de recordar el contenido. El test, el problema de solución única, el dictado, la fórmula que se aplica y devuelve el número que el profesor ya tenía apuntado. Todo aquel andamiaje premiaba una sola cosa, dar con la respuesta correcta a una pregunta cerrada, y debajo latía una idea silenciosa sobre la naturaleza del saber: la respuesta existe, ahí fuera, completa, y la tarea del alumno consiste en encontrarla.

Durante buena parte del siglo XX el modelo no era ningún disparate. La base de conocimiento que la escuela transmitía era estable, y la escuela tenía casi el monopolio de transmitirla. Dos por dos son cuatro. La batalla de Hastings fue en 1066. El Ebro desemboca en el Mediterráneo. En ese terreno la binaridad no es un defecto sino la herramienta exacta, y exigir matices probabilísticos a quien aprende geografía elemental sería pedantería.

El problema aparece donde el conocimiento exige juicio bajo incertidumbre, y resulta que ese territorio es, casualmente, donde el adulto se juega algo. Diagnóstico médico, pronóstico económico, evaluación de riesgo, interpretación jurídica, decisión política: ninguno de esos campos admite una respuesta correcta única, todos admiten respuestas más o menos probables. La escuela entrenó a operar como si la vida fuera aritmética cuando la vida, en casi todo lo que cuenta, se parece mucho más a un diagnóstico.

Un torneo que midió quién acierta

Entre 2011 y 2015, Philip Tetlock y Barbara Mellers dirigieron desde la Universidad de Pensilvania el Good Judgment Project, uno de los equipos que compitió en un torneo de pronóstico financiado por la Intelligence Advanced Research Projects Activity (IARPA, la agencia de investigación del aparato de inteligencia estadounidense). La pregunta de partida era empírica y, por una vez, medible: ¿qué distingue a quien pronostica bien eventos geopolíticos y económicos de quien pronostica mal? Miles de voluntarios, cuatro años, cientos de preguntas con resolución posterior verificable.

El hallazgo incómodo, recogido en Superforecasting, el libro que Tetlock firmó con Dan Gardner, fue que los mejores pronosticadores del torneo —los que el proyecto bautizó como superforecasters— superaban en más de un treinta por ciento, en calibración, a analistas profesionales de inteligencia con acceso a información clasificada. No vencían por cociente intelectual, que tenían medio-alto y no extremo, ni por una formación especializada que la mayoría no tenía. Vencían por hábitos, y los hábitos no escondían ningún misterio.

Donde casi todo el mundo usa categorías borrosas, el superforecaster piensa en porcentajes finos: dice «sesenta por ciento» allí donde otro diría «probable» y se quedaría tan ancho. Cuando llega información nueva no salta de una certeza a la contraria, ajusta su estimación en pequeños incrementos. Sospecha de su propia hipótesis y sale a buscar lo que la contradice antes que lo que la confirma. Descompone la pregunta gruesa en preguntas pequeñas que puede atacar por separado. Y habita la incertidumbre sin angustia, porque para él «no lo sé con seguridad» es un punto de partida sensato y no una confesión de debilidad.

Lo decisivo para este asunto es la última pieza, fácil de pasar por alto: todo eso se entrena. Un módulo de formación que se leía en torno a una hora bastó, dentro del propio torneo, para que los participantes entrenados batieran de forma consistente al grupo de control a lo largo de los cuatro años. No fue una mejora puntual que se evaporara al mes. Si una hora de lectura mueve la aguja durante años, cabe preguntarse qué haría una asignatura.

Por qué no llega al aula

La explicación no es única, y conviene desconfiar de quien la ofrezca redonda. Hay varias causas, y se sostienen unas a otras.

Está la inercia, para empezar. El sistema educativo se diseñó para otra época y gira despacio; los planes de estudio, los manuales y la formación del profesorado tardan décadas en cambiar de rumbo, y nadie tiene prisa por mover una maquinaria que aparenta funcionar. Está, además, la comodidad de la corrección: el examen binario se corrige casi a ojo, mientras que un examen calibrado —donde el alumno reparte probabilidad entre varias opciones y se le puntúa por lo bien ajustada que estaba— resulta trabajoso y raro, aunque pruebas internacionales como PISA o TIMSS hayan incorporado la idea de forma parcial en la última década. Se añade un currículo ya saturado, en el que meter razonamiento bajo incertidumbre obliga a sacar otra cosa, y los ministerios prefieren acumular contenido a sustituirlo. Y debajo de todo está el propio profesorado, que difícilmente enseñará un marco que su formación pedagógica apenas rozó.

Hay quien lleva treinta años señalando exactamente este agujero. Gerd Gigerenzer, director durante años del Max Planck Institute for Human Development de Berlín y fundador del Harding Center for Risk Literacy, sostiene que el currículo debería incluir alfabetización en riesgo (risk literacy). En Risk Savvy (Viking, 2014) documenta que médicos, jueces, periodistas, profesores y políticos cometen errores sistemáticos al interpretar estadísticas elementales, los mismos que reproduce el alumno medio porque imitó el modo binario que se le enseñó.

Su ejemplo más conocido es la mamografía. Puesto a interpretar un cribado positivo, el grueso de los médicos sobrestima de forma drástica la probabilidad real de que la mujer tenga cáncer: en encuestas controladas la sitúan muy por encima del valor verdadero, que queda por debajo del diez por ciento. No es un fallo de cálculo, es un fallo de marco. Cuando la misma información se presenta en frecuencias naturales —«diez de cada cien» en lugar de un porcentaje condicionado— el error se desploma. Eso, justamente eso, es lo que la escuela podría enseñar en una tarde y no enseña en doce años.

La máquina que afirma sin saber

Conviene mirar por dentro lo que hace un modelo de lenguaje, porque la jerga comercial tiende a esconderlo. Cada palabra que genera (cada token, la unidad mínima de texto que produce de una en una) es un muestreo de una distribución sobre el vocabulario, condicionada por todo lo anterior. Lo que el usuario lee no es una verdad recuperada de un almacén; es una de muchas trayectorias plausibles, la que salió esta vez.

Ahí está la trampa. La fluidez de la frase tapa que la frase es una apuesta. El modelo afirma «Madrid es la capital de España» con el mismo aplomo textual con que afirma «la causa principal de la inflación en 2024 fue la política monetaria», y sin embargo la primera tiene una probabilidad casi unitaria y la segunda es discutible y depende de a quién se pregunte. Quien no piensa en grados las recibe idénticas, planas, igual de ciertas, y actúa en consecuencia.

De ahí se abre una grieta entre dos formas de usar la herramienta. Sin marco probabilístico, el usuario trata al modelo como oráculo y se limita a preguntar, recibir y aplicar. Con marco probabilístico, lo trata como una fuente más que exige triangulación, y entonces pregunta, recibe, contrasta y decide. Que la diferencia de provecho entre ambos perfiles es grande lo sugiere la investigación sobre IA en trabajo cualificado: el experimento de Dell'Acqua y otros sobre la «frontera tecnológica irregular» mostró que la misma herramienta mejora unas tareas y empeora otras según cómo se use. La lectura concreta de ese resultado en clave de pensamiento probabilístico la pongo yo, no el estudio.

No es que la IA inventara la necesidad de pensar en probabilidades; lo que hizo fue encarecer el no hacerlo. Antes, el ciudadano sin ese marco podía sobrevivir delegando en autoridades reconocibles, el médico, el notario, el periodista. Ahora la delegación se complica, porque la autoridad misma llega mediada por modelos probabilísticos que nadie le explica y que no son transparentes ni siquiera para quien los vende.

Lo que se decide en la cabina de voto

Aquí entro yo, y lo aviso: lo que sigue es opinión mía, aunque apoyada en lo que la literatura sobre alfabetización estadística viene mostrando. Una ciudadanía sin marco probabilístico es una ciudadanía manipulable. Oscila entre el pánico infundado y la falsa tranquilidad, no sabe leer una política basada en evidencia y, lo peor, no se da cuenta de que no sabe.

Los ejemplos recientes se acumulan, y conviene mirarlos de cerca porque cada uno falla de una manera distinta. Durante la pandemia, el debate público sobre la eficacia de las medidas, las tasas de mortalidad o los resultados de los ensayos se sostuvo sobre una alfabetización estadística pobre: los porcentajes se leyeron como certezas, los intervalos de confianza se ignoraron y un pronóstico puntual se confundió alegremente con la predicción de un hecho consumado. Con el clima ocurre algo parecido pero en sentido inverso. Los informes del IPCC usan una escala calibrada y explícita —«muy probable» equivale a una probabilidad del 90 al 100 por ciento, «probable» al 66 al 100— y la traducción mediática la tritura hasta dejarla en un sí o un no rotundo. Y persiste el viejo sesgo que documentaron Kahneman y Tversky en 1974, el que infla el miedo a lo vívido y raro, el atentado, frente a lo cotidiano y mortal, el coche o el corazón, orientando el gasto público de forma desproporcionada respecto al riesgo real.

La democracia presupone un electorado capaz de evaluar evidencia, la evidencia llega en formato probabilístico y la escuela entrena a leerla en binario. El desfase no es una anécdota de pedagogos.

Los últimos datos de PISA dan la dimensión del agujero. En PISA 2022, publicado por la OCDE en diciembre de 2023, la media de los países de la OCDE en matemáticas cayó hasta los 472 puntos, casi quince por debajo de 2018, el mayor descenso registrado entre dos ediciones consecutivas. Dentro de la competencia matemática, la subdimensión que mide razonamiento con incertidumbre y datos sigue estando entre las más flojas, y deja a buena parte del alumnado por debajo del umbral en el que se interpreta una distribución estadística elemental. El binario que se aprendió en el aula reaparece intacto, años después, en la mano que marca la papeleta.

Definiciones

Calibración. Propiedad de un pronóstico cuya probabilidad declarada coincide con la frecuencia real de aciertos. Quien dice «setenta por ciento» calibra bien si, a la larga, acierta setenta de cada cien veces que lo dice.

Superforecaster. Pronosticador identificado en el Good Judgment Project por su calibración sostenidamente superior a la media, capaz de actualizar sus estimaciones de forma gradual ante nueva información.

Risk literacy. Alfabetización en evaluación de riesgo: capacidad, en términos de Gigerenzer, de interpretar probabilidades, frecuencias y distribuciones aplicadas a decisiones de la vida diaria.

Frecuencias naturales. Forma de presentar información probabilística como «diez de cada cien» en lugar de un porcentaje condicionado; facilita el razonamiento bayesiano y reduce los errores de interpretación.

Token. Unidad mínima de texto, una palabra o un fragmento de palabra, que un modelo de lenguaje genera de una en una, muestreándola de una distribución de probabilidad sobre el vocabulario.

Referencias

Philip Tetlock y Dan Gardner — Superforecasting: The Art and Science of Prediction (Crown, 2015). Fuente principal del artículo para los hábitos de los superforecasters y los resultados del Good Judgment Project.

Good Judgment Project / IARPA. Torneo de pronóstico geopolítico (2011-2015) dirigido por Philip Tetlock y Barbara Mellers en la Universidad de Pensilvania, base de los datos sobre acierto frente a analistas de inteligencia y sobre el efecto del módulo de formación. Verificado en Good Judgment Inc. (goodjudgment.com/about) y en la entrada del proyecto en Wikipedia.

Gerd Gigerenzer — Risk Savvy: How to Make Good Decisions (Viking, 2014). Fuente del argumento sobre alfabetización en riesgo y del ejemplo de la mamografía; el valor real del cribado positivo, en torno al ocho-diez por ciento, procede del trabajo de Gigerenzer y Hoffrage sobre frecuencias naturales.

Amos Tversky y Daniel Kahneman — Judgment under Uncertainty: Heuristics and Biases, Science 185 (1974), pp. 1124-1131; y Daniel Kahneman — Thinking, Fast and Slow (Farrar, Straus and Giroux, 2011). Origen del trabajo sobre sesgos en la percepción del riesgo.

Fabrizio Dell'Acqua y otros — Navigating the Jagged Technological Frontier, Harvard Business School Working Paper 24-013 (septiembre de 2023). Citado a propósito de la disparidad de provecho según cómo se use la herramienta de IA.

OECD — PISA 2022 Results, Volume I: The State of Learning and Equity in Education (diciembre de 2023). Fuente de la media de matemáticas (472 puntos) y del descenso de casi quince puntos respecto a 2018.

IPCC. La escala calibrada de probabilidad («muy probable» 90-100%, «probable» 66-100%) procede de las guías de tratamiento de la incertidumbre del IPCC para sus informes de evaluación.

Para profundizar

Philip Tetlock — Expert Political Judgment: How Good Is It? How Can We Know? (Princeton University Press, 2005). La obra previa que abrió el camino al Good Judgment Project.

Gerd Gigerenzer y Ulrich Hoffrage — How to Improve Bayesian Reasoning Without Instruction: Frequency Formats, Psychological Review 102 (1995).

David Spiegelhalter — The Art of Statistics (Pelican, 2019).

Judea Pearl y Dana Mackenzie — The Book of Why (Basic Books, 2018).

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario