推理的錯覺:震撼 AI 世界的爭論
Apple 發表了兩篇毀滅性的論文-「GSM-Symbolic」(2024 年 10 月)和「The Illusion of Thinking」(2025 年 6 月)-這兩篇論文展示了 LLM 如何在經典問題(河內塔、過河)的小變化上失敗:「當僅改變數值時,性能會下降」。在複雜的河內塔問題上零成功。但 Alex Lawsen (Open Philanthropy) 以「思考的錯覺」(The Illusion of Thinking) 作為反駁,展示失敗的方法論:失敗的原因是符號輸出限制而非推理崩潰、自動腳本錯誤分類部分正確輸出、有些謎題在數學上是無法解決的。Claude/Gemini/GPT 以遞迴函數重複測試,而非列出步驟,解決了河內塔 15 次的記錄。Gary Marcus 接受蘋果有關「分佈轉移」的論點,但 WWDC 前的時間論文提出了策略性的問題。商業影響:關鍵任務對 AI 的信任程度?解決方案:神經符號方法 神經網路用於模式識別+語言,符號系統用於形式邏輯。舉例說明:AI 會計了解「多少差旅費?」,但 SQL/計算/稅務稽核 = 確定性程式碼。

當AI推理遇上現實:機器人正確套用了邏輯規則,卻把籃球誤認成柳橙。這正是一個絕佳的隱喻,說明LLM如何能夠模擬邏輯過程,卻不具備真正的理解能力。
近幾個月來,人工智慧社群掀起了一場激烈辯論,起因於apple發表的兩篇具影響力的研究論文。第一篇,illusione-del-ragionamento-il-dibattito-che-sta-scuotendo-il-mondo-dell-ai&_bhlid=a540c17e5de7c2723906dabd9b8f31cdf0c5bf18" target="_blank" id="">「GSM-Symbolic」(2024年10月),以及第二篇,「The Illusion of Thinking」(2025年6月),都對大型語言模型所謂的推理能力提出質疑,在整個業界引發了兩極反應。
正如我們先前在《進步的幻象:模擬通用人工智慧卻無法真正達成》的深入分析中所探討的,人工推理的議題觸及了我們對機器智慧認知的核心。
蘋果研究報告指出
Apple的研究人員對大型推理模型(Large Reasoning Models,LRM)——那些在給出答案前會產生詳細推理過程的模型——進行了系統性分析。結果令人驚訝,對許多人而言更是令人擔憂。
進行的測試
這項研究讓最先進的模型接受經典演算法謎題的考驗,例如:
- 河內塔:一個於1957年首次被解出的數學謎題
- 過河問題:具有特定限制條件的邏輯謎題
- GSM-Symbolic基準測試:小學程度數學問題的各種變化題型
用經典謎題測試推理能力:農夫、狼、羊與白菜的問題是Apple研究中用來評估LLM推理能力所採用的邏輯謎題之一。難點在於找到正確的過河順序,避免狼在無人看管時吃掉羊,或羊吃掉白菜。這是一個簡單卻有效的測試,用來區分演算法理解與模式記憶。
具爭議性的結果
結果顯示,即使問題表述上的微小改動,也會導致效能出現顯著變化,這顯示出推理能力存在令人擔憂的脆弱性。正如AppleInsider的報導所述:「當GSM-Symbolic基準測試題目中僅改變數值時,所有模型的效能都會下降」。
反攻:思考的假象
AI社群的回應很快就到來。Open Philanthropy的Alex Lawsen與Anthropic的Claude Opus合作,發表了一篇題為「The Illusion of the Illusion of Thinking」的詳細反駁文章,質疑Apple研究的方法論與結論。
主要的反對意見
- 被忽略的輸出限制:許多歸因於「推理崩潰」的失敗,實際上是由於模型輸出token數量的限制所致
- 評估錯誤:自動化腳本把雖然只完成部分但演算法正確的輸出,也歸類為完全失敗
- 不可能的問題:有些謎題在數學上根本無解,但模型卻因為沒有解出而受到懲罰
確認測試
當Lawsen改用其他方法重新測試——要求模型產生遞迴函式而不是列出所有步驟——結果出現了戲劇性的差異。像Claude、gemini和GPT這樣的模型,成功正確解出了15個圓盤的河內塔問題,遠遠超出Apple報告中顯示零成功率的複雜度範圍。
辯論中的權威聲音
Gary Marcus:歷史評論家
Gary Marcus,一向對LLM的推理能力持批評態度,將蘋果的研究結果視為對其二十年來論點的證實。根據Marcus的說法,LLM持續與「分佈偏移」(distribution shift)問題苦苦搏鬥——也就是超越訓練資料進行泛化的能力——始終只是「已解決問題的優秀解題者」。
LocalLlama 社群
這場討論也擴展到了如Reddit上的LocalLlama這樣的專業社群,開發者和研究人員在此討論開源模型和本地部署的實際影響。
超越爭議:對公司的意義
策略影響
這場辯論並非純學術性的。它對以下方面有直接影響:
- 生產環境中的AI部署:我們對模型執行關鍵任務能有多少信任?
- 研發投資:應將資源集中在哪裡才能實現下一次突破?
- 與利害關係人的溝通:如何管理對AI能力的合理期望?
神經符號方式
正如多篇技術深度分析所指出的,需要結合以下要素的混合式方法愈發明確:
- 神經網路用於模式識別和語言理解
- 符號系統用於演算法推理和形式邏輯
簡單範例:一個協助記帳的AI助理。語言模型能理解當你問「這個月我在出差上花了多少錢?」時,並提取相關參數(類別:出差,期間:本月)。但查詢資料庫的SQL語句、加總計算、以及稅務限制的驗證呢?這些都是由確定性程式碼完成的,而非神經模型。
時機與策略背景
觀察者們注意到,蘋果的論文發布時間恰好在WWDC之前,這引發了關於其戰略動機的質疑。正如9to5Mac的分析所指出的:「蘋果論文的發布時機——恰好在WWDC之前——引起了一些人的質疑。這究竟是一個研究里程碑,還是重新定位蘋果在更廣泛AI版圖中地位的策略性舉動?」
未來的教訓
研究人員
- 實驗設計:區分架構限制與實作約束的重要性
- 嚴謹評估:需要能將認知能力與實務限制區分開來的複雜基準測試
- 方法論透明度:完整記錄實驗設置與限制的義務
針對公司
- 合理的期望:在不放棄未來潛力的前提下,承認當前的局限
- 混合式方法:投資於結合不同技術優勢的解決方案
- 持續評估:實施能反映真實使用場景的測試系統
結論:駕馭不確定性
蘋果論文所引發的這場辯論,提醒我們對人工智慧的理解仍處於初期階段。正如我們先前文章中所強調的,模擬與真正推理之間的區別,仍是我們這個時代最複雜的挑戰之一。
真正的教訓不在於 LLM 是否能夠達到人類所謂的「推理」能力,而是我們該如何建立既能發揮其優點,又能彌補其缺點的系統。在這個人工智能已經在改變整個行業的世界裡,問題不再是這些工具是否「聰明」,而是如何有效且負責任地使用它們。
企業級 AI 的未來可能不在於單一的革命性方法,而是在於幾種互補技術的智慧型協調。在這種情況下,批判且誠實地評估我們工具能力的能力本身就成為了一種競爭優勢。
最新進展(2026年1月)
OpenAI 發布 o3 和 o4-mini:2025 年 4 月 16 日,OpenAI 正式發布了 o3 和 o4-mini,這是 o 系列中最先進的推理模型。這些模型現在能夠以代理方式使用工具,結合網頁搜尋、檔案分析、視覺推理和圖像生成。o3 在 Codeforces、SWE-bench 和 MMMU 等基準測試中創下新紀錄,而 o4-mini 則針對高流量推理任務優化了性能與成本。這些模型展現出「用圖像思考」的能力,能夠對內容進行視覺化轉換以進行更深入的分析。
DeepSeek-R1 震撼 AI 產業:2025 年 1 月,DeepSeek 發布了 R1,這是一款開源推理模型,其性能與 OpenAI o1 相當,但訓練成本僅為 600 萬美元(相較於西方模型動輒數億美元)。DeepSeek-R1 證明了推理能力可以透過純粹的強化學習來激發,而不需要人工標註的示範資料。該模型在數十個國家的 App Store 和 Google Play 上成為免費應用程式排行榜第一名。2026 年 1 月,DeepSeek 發布了一篇擴充至 60 頁的論文,揭示訓練的祕密,並坦承像蒙地卡羅樹搜尋(MCTS)這類技術在通用推理方面並未奏效。
Anthropic 更新 Claude 的「憲章」:2026 年 1 月 22 日,Anthropic 為 Claude 發布了一份新的 23,000 字憲章,從基於規則的方法轉向基於理解倫理原則的方法。該文件成為大型 AI 公司首個正式承認 AI 可能具有意識或道德地位的框架,並表示 Anthropic 關心 Claude 的「心理健康、自我意識與福祉」。
爭論持續升溫:2025 年 7 月的一項研究複製並改進了 Apple 的基準測試,證實當複雜度適度增加時(河內塔約 8 個圓盤),LRM 仍表現出認知上的限制。研究人員證明,這不僅僅是輸出限制所致,也涉及真實的認知極限,凸顯這場爭論遠未結束。
如需深入了解貴組織的 AI 策略以及穩健解決方案的實施,我們的專家團隊隨時提供客製化諮詢服務。
來源與參考資料:
- GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models - Apple Machine Learning Research
- The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models - Apple Machine Learning Research
- New paper pushes back on Apple's LLM 'reasoning collapse' study - 9to5Mac
- Seven replies to the viral Apple reasoning paper - Gary Marcus
- The Illusion of Thinking: What the Apple AI Paper Says About LLM Reasoning - Arize AI
- Apple's study proves that LLM-based AI models are flawed - AppleInsider
- L'illusione del progresso: simulare l'intelligenza artificiale generale senza raggiungerla - Electe

留言
尚無留言——開始討論吧。