El paper «LLMs Can’t Jump» de Tom Zahavy (Google DeepMind, 2026) plantea que los modelos de lenguaje dominan la inducción y la deducción, pero carecen de un mecanismo explícito para producir el “salto abductivo”: la capacidad de proponer una premisa radicalmente nueva que reordene el problema desde su raíz. Este análisis recorre los fundamentos filosóficos del argumento, sus implicaciones para sistemas de IA en retail y los límites empíricos de la tesis.
Tom Zahavy y el paper que sacude el debate sobre creatividad en IA
Tom Zahavy es Research Scientist en Google DeepMind y co-lidera el programa de investigación en Discovery. Lejos de ser un crítico externo de la inteligencia artificial, Zahavy construye sistemas para ampliarla: AlphaProof (demostración matemática con aprendizaje por refuerzo), COrigami (diseño de patrones de plegado con Gemini y retroalimentación visual) y PuzzleGen (generación de puzzles de ajedrez que maximizan novedad y contraintuición). Desde esa posición, su position paper de 10 páginas resulta especialmente provocador: no es la crítica de un escéptico, sino la pregunta más honesta que puede formularse alguien que intenta hacer creativa a la IA.
La tesis central puede resumirse en una frase: los LLMs dominan patrones y mejoran en pruebas formales, pero no poseen un mecanismo explícito para proponer una nueva explicación que cambie las reglas del problema. Zahavy denomina a esa operación abductiva “the Jump”.
El marco de Peirce: tres modos de razonamiento
Para entender el argumento, Zahavy recurre a la distinción clásica de Charles Sanders Peirce entre tres operaciones cognitivas que, aunque interrelacionadas, realizan trabajos fundamentalmente distintos:
- Inducción: De casos observados y resultados se extrae una regla. Es el mecanismo por el que se aprenden regularidades desde la experiencia. Un LLM aprende por inducción.
- Deducción: De una regla conocida y un caso dado se deriva el resultado esperado. Opera con precisión formal y es trazable. Un LLM razona deductivamente cuando sigue instrucciones o cadenas de razonamiento.
- Abducción: Ante una observación sorprendente, se formula la hipótesis más plausible que la explicaría, aunque esa hipótesis no esté disponible en los datos previos. Es el mecanismo que produce los saltos conceptuales en ciencia.
El caso Einstein como experimento mental
Zahavy ilustra el “salto abductivo” con el proceso creativo de Albert Einstein al formular la relatividad especial. Einstein no tenía “pocos datos” —tenía décadas de conocimiento físico altamente estructurado— pero su avance no provino de comprimir mejor esa información, sino de imaginar un experimento mental que desafíaba la premisa entera del marco clásico: ¿qué vería si viajara junto a un rayo de luz?
El mecanismo propuesto por Zahavy para la abducción genuina sigue cinco pasos: imaginar una escena no observada, intervenir en ella (cambiar posición, fuerza, observador), sentir o predecir cómo se experimentaría, reformular una relación causal nueva y, finalmente, formalizar esa intuición en axiomas comprobables. El punto crítico es el segundo paso: la intervención exige un modelo del mundo donde los contrafactuales tengan consecuencias físicamente consistentes, algo que ningún sistema puramente textual posee.
Lo que un LLM hace bien —y lo que el paper cuestiona
El paper no niega las capacidades de los modelos de lenguaje; las delimita con precisión. Existen tres capacidades bien establecidas y tres mecanismos cuestionados:
| Dimensión | LLMs (fortaleza) | Abducción genérina (límite propuesto) |
|---|---|---|
| Patrones lingüísticos | Inducción y compresión de regularidades a gran escala | Nueva ontología: entidades o relaciones no dadas en entrenamiento |
| Razonamiento formal | Deducción asistida, cadenas de prueba, reglas | Anclaje vivido: conectar símbolo, percepción y acción física |
| Recombinación creativa | Variaciones útiles dentro de marcos conocidos | Intervención causal: probar mundos posibles, no solo describirlos |
| Symbol Grounding | Descripción rica en lenguaje natural | Ciclo percepción–acción, no sólo texto sobre percepciones |
| Aprendizaje continuo | Compresión de corpus de texto masivo | Actualización de pesos a partir de evidencia validada en tiempo real |
La diferencia entre predicción pasiva y simulación interactiva
Zahavy propone un criterio de diseño claro: mirar no es intervenir. Un modelo de predicción de video aprende regularidades observadas y puede anticipar lo probable (videoₜ → videoₜ₊₁). Pero el razonamiento abductivo requiere simulación interactiva: dado un estado y una acción, ¿qué futuro emerge? Comparar intervenciones permite aislar causas y explorar lo posible, no solo lo probable.
Esto lleva a la propuesta arquitectónica del paper: modelos de mundo multimodales, controlables por acción y físicamente consistentes. No basta predecir el próximo fotograma; hay que poder actuar y descubrir qué cambia.
¿Puede la alucinación ser un salto embrionario?
Una de las ideas más provocadoras del análisis es la conexión entre alucinación y hipótesis. La tesis es que una alucinación puede ser el intento del modelo de salir de su marco. Algunas podrían ser hipótesis aún no verificadas, no simples fallas. Sin embargo, sin un criterio de verdad operativo y sin actualización persistente de los pesos, el error no modifica el comportamiento futuro y la novedad generada no puede llamarse aprendizaje.
La conclusión es precisa: la alucinación no es el aprendizaje; es una hipótesis candidata. La evolución ocurre solo cuando la evidencia cambia el comportamiento futuro dentro de un ciclo de especulación, calibración, intervención, verificación y actualización.
Conexión directa con los casos de retail del diplomado
El paper cobra un significado operativo preciso cuando se contrasta con los casos de IA en retail revisados en el diplomado. En todos ellos, los sistemas de IA optimizan marcos que los humanos siguen definiendo:
- HOPLA (Carrefour): Busca y recomienda dentro del catálogo. Marco: catálogo, políticas, intención de compra.
- Billie (IKEA): Resuelve consultas y escala excepciones. Marco: flujos de servicio y reglas de atención.
- Movebox (H&M): Redistribuye inventario hacia demanda esperada. Marco: SKU, localización, costes y forecast.
- Pactum AI (Walmart): Negocia dentro de un Contract Space autorizado. Marco: límites, función de valor y guardrails.
La empresa humana sigue definiendo el problema, la ontología, los objetivos y los límites. La IA ejecuta con una velocidad y consistencia extraordinarias dentro de ese mapa. La pregunta de Zahavy es quién —o qué sistema— puede dibujar uno nuevo.
La escalera de innovación
Zahavy propone una escalera de cuatro peldaños que ordena las capacidades de los sistemas de IA según el nivel de novedad que producen:
- Responder: Usar conocimiento existente.
- Predecir: Aprender regularidades.
- Decidir: Elegir dentro de reglas establecidas.
- Redefinir: Crear un nuevo marco explicativo.
La controversia del paper se ubica en el cuarto peldaño. Los tres primeros ya generan un enorme valor económico y son los que actualmente despliegan las empresas de retail más avanzadas. El debate sobre si los sistemas actuales pueden alcanzar el cuarto sigue abierto.
Una lectura crítica honesta
El propio Zahavy reconoce que su tesis es un position paper argumentado, no un teorema demostrado. Las preguntas abiertas más relevantes son:
- ¿Qué cuenta como abducción genuina y cómo se mide objetivamente?
- ¿Una recombinación suficientemente lejana deja de ser recombinación?
- ¿Evaluamos un LLM aislado o un sistema con memoria, herramientas, aprendizaje por refuerzo y simulación interactiva?
- ¿Un solo caso histórico (Einstein) es suficiente para concluir una incapacidad general?
La última pregunta es quizá la más fructífera para el campo: si el Jump abductivo pertenece no a un modelo sino a un ciclo completo de interacción con el mundo, entonces la respuesta correcta no es mejorar el LLM aislado, sino diseñar el sistema que lo rodea.
Síntesis: fluidez no es salto
Un modelo de lenguaje puede recorrer un mapa con velocidad y precisión extraordinarias. La pregunta de Zahavy es quién —o qué sistema— puede dibujar uno nuevo. Inducción aprende. Deducción deriva. Abducción propone. Pensar, hablar y explicar siguen siendo problemas relacionados, pero no idénticos.
Este artículo complementa la serie sobre capacidades y límites de los LLMs: Evolución del ML y LLM en Retail ofrece el contexto de adopción, y RAG con Bases de Datos Gráficas explora cómo compensar estas limitaciones con arquitecturas complementarias.