La ilusión del razonamiento: el debate que sacude el mundo de la IA
Apple publica dos artículos devastadores -'GSM-Symbolic' (octubre de 2024) y 'The Illusion of Thinking' (junio de 2025)- que demuestran cómo LLM falla en pequeñas variaciones de problemas clásicos (Torre de Hanoi, cruce de ríos): 'el rendimiento disminuye cuando sólo se alteran los valores numéricos'. Cero éxito en la compleja Torre de Hanoi. Pero Alex Lawsen (Open Philanthropy) replica con "The Illusion of Thinking" (La ilusión de pensar) demostrando una metodología fallida: los fallos fueron los límites de salida de los tokens no el colapso del razonamiento, los scripts automáticos clasificaron erróneamente salidas correctas parciales, algunos puzzles eran matemáticamente irresolubles. Repitiendo las pruebas con funciones recursivas en lugar de enumerar los movimientos, Claude/Gemini/GPT resolvieron la Torre de Hanoi 15 veces. Gary Marcus hace suya la tesis de Apple sobre el "cambio de distribución", pero el documento sobre el momento previo a la WWDC plantea cuestiones estratégicas. Implicaciones empresariales: ¿hasta qué punto confiar en la IA para tareas críticas? Solución: enfoques neurosimbólicos redes neuronales para reconocimiento de patrones+lenguaje, sistemas simbólicos para lógica formal. Ejemplo: La IA contable entiende "¿cuántos gastos de viaje?", pero SQL/cálculos/auditorías fiscales = código determinista.

Cuando el razonamiento de la IA se encuentra con la realidad: el robot aplica correctamente la regla lógica pero identifica el balón de baloncesto como una naranja. Una metáfora perfecta de cómo los LLM pueden simular procesos lógicos sin poseer una verdadera comprensión.
En los últimos meses, la comunidad de la inteligencia artificial se ha visto atravesada por un acalorado debate desencadenado por dos influyentes papers de investigación publicados por apple. El primero, illusione-del-ragionamento-il-dibattito-che-sta-scuotendo-il-mondo-dell-ai&_bhlid=a540c17e5de7c2723906dabd9b8f31cdf0c5bf18" target="_blank" id="">"GSM-Symbolic" (octubre 2024), y el segundo, "The Illusion of Thinking" (junio 2025), pusieron en duda las supuestas capacidades de razonamiento de los Large Language Models, desatando reacciones contrastantes en todo el sector.
Como ya analizamos en nuestro anterior análisis sobre "La Ilusión del Progreso: Simular la Inteligencia Artificial General Sin Alcanzarla", la cuestión del razonamiento artificial toca el corazón mismo de lo que consideramos inteligencia en las máquinas.
Lo que dicen los estudios de Apple
Los investigadores de Apple llevaron a cabo un análisis sistemático de los Large Reasoning Models (LRM), esos modelos que generan trazas de razonamiento detalladas antes de ofrecer una respuesta. Los resultados fueron sorprendentes y, para muchos, alarmantes.
Pruebas realizadas
El estudio sometió los modelos más avanzados a rompecabezas algorítmicos clásicos como:
- Torre de Hanói: Un rompecabezas matemático resuelto por primera vez en 1957
- Problemas de cruce del río: Acertijos lógicos con restricciones específicas
- Benchmark GSM-Symbolic: Variaciones de problemas matemáticos de nivel elemental
Probar el razonamiento con acertijos clásicos: el problema del granjero, el lobo, la cabra y la col es uno de los rompecabezas lógicos utilizados en los estudios de Apple para evaluar las capacidades de razonamiento de los LLM. La dificultad está en encontrar la secuencia correcta de cruces evitando que el lobo se coma a la cabra o la cabra se coma la col cuando se quedan solos. Una prueba simple pero eficaz para distinguir entre comprensión algorítmica y memorización de patrones.
Resultados controvertidos
Los resultados mostraron que incluso pequeñas modificaciones en la formulación de los problemas provocan variaciones significativas en el rendimiento, sugiriendo una fragilidad preocupante en el razonamiento. Como se informa en la cobertura de AppleInsider, "el rendimiento de todos los modelos disminuye cuando se alteran solo los valores numéricos en las preguntas del benchmark GSM-Symbolic".
La contraofensiva: la ilusión de pensar
La respuesta de la comunidad de IA no se hizo esperar. Alex Lawsen, de Open Philanthropy, en colaboración con Claude Opus de Anthropic, publicó una réplica detallada titulada "The Illusion of the Illusion of Thinking", cuestionando las metodologías y conclusiones del estudio de Apple.
Principales objeciones
- Límites de Salida Ignorados: Muchos de los fallos atribuidos al "colapso del razonamiento" en realidad se debían a los límites de tokens de salida de los modelos
- Evaluación Errónea: Los scripts automáticos clasificaban como fallos totales incluso salidas parciales pero algorítmicamente correctas
- Problemas Imposibles: Algunos rompecabezas eran matemáticamente irresolubles, pero los modelos eran penalizados por no resolverlos
Pruebas de confirmación
Cuando Lawsen repitió las pruebas con metodologías alternativas —pidiendo a los modelos que generaran funciones recursivas en lugar de enumerar todos los movimientos—, los resultados fueron drásticamente diferentes. Modelos como Claude, gemini y GPT resolvieron correctamente problemas de la Torre de Hanói con 15 discos, muy por encima de la complejidad en la que Apple reportaba cero éxitos.
Voces autorizadas en el debate
Gary Marcus: el crítico histórico
Gary Marcus, siempre crítico de las capacidades de razonamiento de los LLM, ha abrazado los resultados de Apple como confirmación de sus tesis de veinte años. Según Marcus, los LLM siguen luchando con el "distribution shift" - la capacidad de generalizar más allá de los datos de entrenamiento - permaneciendo "buenos resolutores de problemas ya resueltos".
Comunidad LocalLlama
La discusión se ha extendido también a comunidades especializadas como LocalLlama en Reddit, donde desarrolladores e investigadores debaten las implicaciones prácticas para los modelos open-source y la implementación local.
Más allá de la polémica: qué significa para las empresas
Implicaciones estratégicas
Este debate no es puramente académico. Tiene implicaciones directas para:
- Deployment de IA en Producción: ¿Cuánto podemos confiar en los modelos para tareas críticas?
- Inversiones en I+D: ¿Dónde concentrar los recursos para el próximo breakthrough?
- Comunicación con Stakeholders: ¿Cómo gestionar expectativas realistas sobre las capacidades de la IA?
La vía neurosimbólica
Como se destaca en varios análisis técnicos, surge cada vez más claramente la necesidad de enfoques híbridos que combinen:
- Redes neuronales para el pattern recognition y la comprensión del lenguaje
- Sistemas simbólicos para el razonamiento algorítmico y la lógica formal
Ejemplo banal: un asistente de IA que ayuda con la contabilidad. El modelo de lenguaje entiende cuando preguntas "¿cuánto gasté en viajes este mes?" y extrae los parámetros relevantes (categoría: viajes, período: este mes). ¿Pero la consulta SQL que interroga la base de datos, el cálculo de la suma y la verificación de los límites fiscales? Eso lo hace código determinista, no el modelo neuronal.
Calendario y contexto estratégico
No ha pasado desapercibido para los observadores que el paper de Apple fue publicado poco antes del WWDC, lo que plantea interrogantes sobre las motivaciones estratégicas. Como señala el análisis de 9to5Mac, "el timing del paper de Apple - justo antes del WWDC - ha levantado algunas cejas. ¿Era este un hito de investigación, o una jugada estratégica para reposicionar a Apple en el panorama más amplio de la IA?"
Lecciones para el futuro
Para investigadores
- Diseño Experimental: La importancia de distinguir entre limitaciones arquitectónicas y restricciones de implementación
- Evaluación Rigurosa: La necesidad de benchmarks sofisticados que separen capacidades cognitivas de restricciones prácticas
- Transparencia Metodológica: La obligación de documentar completamente los setups experimentales y las limitaciones
Para empresas
- Expectativas Realistas: Reconocer los límites actuales sin renunciar al potencial futuro
- Enfoques Híbridos: Invertir en soluciones que combinen puntos fuertes de diferentes tecnologías
- Evaluación Continua: Implementar sistemas de testing que reflejen escenarios de uso reales
Conclusiones: Navegar por la incertidumbre
El debate surgido a raíz del paper de Apple nos recuerda que aún estamos en las fases iniciales de la comprensión de la inteligencia artificial. Como se subrayó en nuestro artículo anterior, la distinción entre simulación y razonamiento auténtico sigue siendo uno de los desafíos más complejos de nuestro tiempo.
La verdadera lección no es si los LLM pueden o no "razonar" en el sentido humano del término, sino cómo podemos construir sistemas que exploten sus puntos fuertes al tiempo que compensan sus limitaciones. En un mundo en el que la IA ya está transformando sectores enteros, la cuestión ya no es si estas herramientas son "inteligentes", sino cómo utilizarlas de forma eficaz y responsable.
El futuro de la IA empresarial probablemente no radique en un único enfoque revolucionario, sino en la orquestación inteligente de varias tecnologías complementarias. Y en este escenario, la capacidad de evaluar de forma crítica y honesta las capacidades de nuestras herramientas se convierte en una ventaja competitiva en sí misma.
Últimos Desarrollos (Enero 2026)
OpenAI lanza o3 y o4-mini: El 16 de abril de 2025, OpenAI lanzó públicamente o3 y o4-mini, los modelos de reasoning más avanzados de la serie o. Estos modelos ahora pueden utilizar herramientas de forma agéntica, combinando búsqueda web, análisis de archivos, razonamiento visual y generación de imágenes. o3 estableció nuevos récords en benchmarks como Codeforces, SWE-bench y MMMU, mientras que o4-mini optimiza rendimiento y costos para tareas de reasoning de alto volumen. Los modelos demuestran capacidades de "pensamiento con imágenes", transformando visualmente los contenidos para análisis más profundos.
DeepSeek-R1 sacude la industria de la IA: En enero de 2025, DeepSeek lanzó R1, un modelo de razonamiento open-source que alcanzó un rendimiento comparable a OpenAI o1 con un coste de entrenamiento de solo 6 millones de dólares (frente a los cientos de millones de los modelos occidentales). DeepSeek-R1 demuestra que las capacidades de razonamiento pueden incentivarse mediante reinforcement learning puro, sin necesidad de demostraciones humanas anotadas. El modelo se convirtió en la app gratuita #1 en App Store y Google Play en decenas de países. En enero de 2026, DeepSeek publicó un paper ampliado de 60 páginas que revela los secretos del entrenamiento y admite con franqueza que técnicas como Monte Carlo Tree Search (MCTS) no funcionaron para el razonamiento general.
Anthropic actualiza la "Constitución" de Claude: El 22 de enero de 2026, Anthropic publicó una nueva constitución de 23.000 palabras para Claude, pasando de un enfoque basado en reglas a uno basado en la comprensión de los principios éticos. El documento se convierte en el primer framework de una gran empresa de IA en reconocer formalmente la posibilidad de conciencia o estatus moral de la IA, afirmando que Anthropic se preocupa por el "bienestar psicológico, sentido de identidad y bienestar" de Claude.
El debate se intensifica: Un estudio de julio de 2025 replicó y refinó los benchmarks de Apple, confirmando que los LRM aún muestran limitaciones cognitivas cuando la complejidad aumenta moderadamente (alrededor de 8 discos en la Torre de Hanoi). Los investigadores demostraron que esto no depende solo de restricciones de output, sino también de límites cognitivos reales, evidenciando que el debate está lejos de haber concluido.
Para profundizar en la estrategia de IA de su organización y en la implementación de soluciones robustas, nuestro equipo de expertos está a su disposición para consultorías personalizadas.
Fuentes y referencias:
- GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models - Apple Machine Learning Research
- The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models - Apple Machine Learning Research
- New paper pushes back on Apple's LLM 'reasoning collapse' study - 9to5Mac
- Seven replies to the viral Apple reasoning paper - Gary Marcus
- The Illusion of Thinking: What the Apple AI Paper Says About LLM Reasoning - Arize AI
- Apple's study proves that LLM-based AI models are flawed - AppleInsider
- L'illusione del progresso: simulare l'intelligenza artificiale generale senza raggiungerla - Electe

Comentarios
Aún no hay comentarios — inicia la conversación.