推理的幻觉:撼动人工智能世界的争论
苹果公司发表了两篇毁灭性论文--"GSM-符号"(2024 年 10 月)和 "思维的幻觉"(2025 年 6 月)--这两篇论文展示了 LLM 如何在经典问题(河内塔、过河)的微小变化上失效:"仅改变数值时,性能会下降"。在复杂的河内塔问题上零成功。但亚历克斯-劳森(Alex Lawsen,开放慈善组织)以 "思考的幻觉 "为题进行了反驳,展示了失败的方法论:失败的原因是令牌输出限制而非推理崩溃,自动脚本错误地分类了部分正确的输出,有些谜题在数学上是无法解决的。克劳德/杰米尼/GPT 通过使用递归函数重复测试,而不是罗列棋步,创下了河内塔 15 次解题记录。加里-马库斯(Gary Marcus)接受了苹果公司关于 "分布转移 "的理论,但世界计算机大会前的计时论文提出了战略问题。商业影响:在关键任务上对人工智能的信任度有多高?解决方案:神经符号方法 神经网络用于模式识别和语言,符号系统用于形式逻辑。举例说明:人工智能会计可以理解 "多少差旅费?",但 SQL/计算/税务审计 = 确定性代码。

当AI推理遇到现实:机器人正确应用了逻辑规则,却将篮球误认成橙子。这完美地隐喻了大语言模型如何能够模拟逻辑过程,却并不具备真正的理解能力。
近几个月来,人工智能界因apple发表的两篇有影响力的研究论文而掀起了激烈的辩论。第一篇,illusione-del-ragionamento-il-dibattito-che-sta-scuotendo-il-mondo-dell-ai&_bhlid=a540c17e5de7c2723906dabd9b8f31cdf0c5bf18" target="_blank" id="">"GSM-Symbolic"(2024年10月),第二篇,"The Illusion of Thinking"(2025年6月),对大语言模型所谓的推理能力提出了质疑,在整个行业内引发了截然不同的反应。
正如我们之前在《进步的幻觉:模拟通用人工智能而未真正实现它》深入分析中所探讨的那样,人工推理问题触及了我们对机器智能理解的核心。
苹果公司的研究报告
Apple的研究人员对大型推理模型(LRM)——即那些在给出答案之前生成详细推理过程的模型——进行了系统性分析。结果令人惊讶,对许多人来说更是令人担忧。
进行的测试
这项研究对最先进的模型进行了经典算法解谜,例如
- 汉诺塔:一个1957年首次被解决的数学谜题
- 过河问题:具有特定约束条件的逻辑谜题
- GSM-Symbolic基准测试:小学水平数学问题的各种变体
用经典谜题测试推理能力:农夫、狼、山羊和卷心菜问题是Apple研究中用于评估大语言模型推理能力的逻辑谜题之一。其难点在于要找到正确的过河顺序,避免狼和山羊、山羊和卷心菜在无人看管时相遇。这是一个简单却有效的测试,能够区分算法理解与模式记忆。
有争议的结果
结果显示,即使是问题表述上的微小改动,也会导致性能出现显著波动,这表明推理能力存在令人担忧的脆弱性。正如AppleInsider的报道所指出的,“当GSM-Symbolic基准测试问题中仅数值发生变化时,所有模型的性能都会下降”。
反攻:思考的幻觉
人工智能界的回应很快就来了。Open Philanthropy的Alex Lawsen与Anthropic的Claude Opus合作,发表了一篇题为《思考幻觉的幻觉》的详细反驳文章,对Apple研究的方法论和结论提出了质疑。
主要反对意见
- 被忽视的输出限制:许多被归咎于“推理崩溃”的失败,实际上是由于模型的输出token限制所致
- 评估错误:自动化脚本将部分正确但算法上无误的输出也归类为完全失败
- 不可能完成的问题:有些谜题在数学上根本无解,但模型却因未能解决而受到惩罚
确认测试
当Lawsen采用替代方法重新进行测试——要求模型生成递归函数而非列出所有步骤——结果出现了戏剧性的差异。Claude、gemini和GPT等模型成功解决了15个圆盘的汉诺塔问题,远远超出了Apple报告中所称的零成功率的复杂度范围。
辩论中的权威声音
加里-马库斯:历史评论家
Gary Marcus,一直以来对LLM推理能力持批评态度,他将苹果的研究结果视为对其二十年来观点的确认。据Marcus所说,LLM在"分布偏移"(distribution shift)——即超越训练数据进行泛化的能力——方面依然举步维艰,仍然只是"擅长解决已经解决过的问题"。
本地骆驼社区
这场讨论也蔓延到了专业社区,如Reddit上的LocalLlama,开发者和研究人员在那里就开源模型和本地部署的实际影响展开辩论。
超越争议:对公司的意义
战略意义
这场辩论并不纯粹是学术性的。它直接影响到:
- 生产环境中的AI部署:我们能在多大程度上信任模型执行关键任务?
- 研发投入:应将资源集中投向何处以实现下一次突破?
- 与利益相关者的沟通:如何管理对AI能力的合理预期?
神经符号方式
正如多篇技术深度分析所指出的,需要采用混合方法的趋势越来越明显,这种方法应结合以下要素:
- 神经网络用于模式识别和语言理解
- 符号系统用于算法推理和形式逻辑
简单举例:一个协助记账的AI助手。语言模型能理解你问的"这个月我在差旅上花了多少钱?",并提取相关参数(类别:差旅,时间段:本月)。但查询数据库的SQL语句、求和计算以及税务合规检查呢?这些工作由确定性代码完成,而不是神经网络模型。
时机和战略背景
观察者们并未忽视苹果这篇论文正好在WWDC前夕发布这一事实,这引发了对其战略动机的质疑。正如9to5Mac的分析所指出的,"苹果这篇论文的发布时机——恰好在WWDC之前——引起了不少人的关注。这究竟是一项研究里程碑,还是苹果在更广泛的AI格局中重新定位自身的战略举措?"
对未来的启示
研究人员
- 实验设计:区分架构性限制与实现性约束的重要性
- 严谨评估:需要能够将认知能力与实际限制区分开的复杂基准测试
- 方法透明度:完整记录实验设置和局限性的义务
企业
- 合理预期:承认当前局限,同时不放弃未来潜力
- 混合方法:投资于结合不同技术优势的解决方案
- 持续评估:实施能反映真实使用场景的测试系统
结论:驾驭不确定性
苹果论文引发的这场辩论提醒我们,我们对人工智能的理解仍处于早期阶段。正如我们此前的文章中所强调的,模拟与真正推理之间的区别仍是我们这个时代最复杂的挑战之一。
真正的教训并不在于 LLM 能否进行人类意义上的 "推理",而在于我们如何才能构建既能利用其优势又能弥补其局限性的系统。在人工智能已经改变整个行业的今天,问题不再是这些工具是否 "聪明",而是如何有效、负责任地使用它们。
企业人工智能的未来可能不在于单一的革命性方法,而在于几种互补技术的智能协调。在这种情况下,批判性地、诚实地评估我们工具能力的能力本身就是一种竞争优势。
最新进展(2026年1月)
OpenAI 发布 o3 和 o4-mini:2025年4月16日,OpenAI 正式发布了 o3 和 o4-mini,这是 o 系列中最先进的推理模型。这些模型现在能够以自主方式使用工具,结合网络搜索、文件分析、视觉推理和图像生成。o3 在 Codeforces、SWE-bench 和 MMMU 等基准测试中创造了新纪录,而 o4-mini 则针对高频推理任务优化了性能和成本。这些模型展现出"用图像思考"的能力,能够以视觉方式转换内容以进行更深入的分析。
DeepSeek-R1 震动 AI 行业:2025年1月,DeepSeek 发布了 R1,这是一款开源推理模型,其训练成本仅为600万美元(相比之下西方模型动辄数亿美元),却达到了与 OpenAI o1 相当的性能。DeepSeek-R1 证明了推理能力可以通过纯粹的强化学习来激发,而无需依赖人工标注的示范数据。该模型已成为数十个国家 App Store 和 Google Play 上排名第一的免费应用。2026年1月,DeepSeek 发布了一篇扩展至60页的论文,揭示了训练的秘密,并坦率承认蒙特卡洛树搜索(MCTS)等技术在通用推理方面并未奏效。
Anthropic 更新 Claude 的"宪法":2026年1月22日,Anthropic 发布了一份长达23,000字的 Claude 新宪法,将方法从基于规则转变为基于对伦理原则的理解。该文件成为首个正式承认 AI 可能具有意识或道德地位的大型 AI 公司框架,声明 Anthropic 关心 Claude 的"心理健康、自我意识和福祉"。
争论愈演愈烈:2025年7月的一项研究复现并完善了苹果的基准测试,证实当复杂度适度增加时(汉诺塔约8个圆盘),LRM 仍然表现出认知局限性。研究人员证明,这不仅仅取决于输出限制,也涉及真实的认知边界,凸显出这场争论远未结束。
如需深入探讨贵组织的 AI 战略及稳健解决方案的实施,我们的专家团队随时为您提供个性化咨询。
资料来源和参考文献:
- GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models - Apple Machine Learning Research
- The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models - Apple Machine Learning Research
- New paper pushes back on Apple's LLM 'reasoning collapse' study - 9to5Mac
- Seven replies to the viral Apple reasoning paper - Gary Marcus
- The Illusion of Thinking: What the Apple AI Paper Says About LLM Reasoning - Arize AI
- Apple's study proves that LLM-based AI models are flawed - AppleInsider
- 进步的幻觉:模拟通用人工智能而未能真正实现它 - Electe

评论
暂无评论——来发表第一条吧。