研究與評測
文章質疑大型推理模型的思維鏈:推理能力確實提升,但生成文字未必忠實
Hacker News未證實

一篇發表於 Quanta Magazine、由 Hacker News 收錄的文章指出,大型推理模型(LRM)在推理任務上的準確率確實優於一般大型語言模型,但模型生成的思維鏈(chain of thought)未必忠實反映內部運作,也不一定是模型得出答案所必需的資訊。文章作者以近期研究的相互矛盾為例:Apple 研究團隊曾指出,LRM 在簡單條件下可能出現「思考幻覺」與準確率完全崩潰;另一方面,LRM 又曾在國際數學奧林匹亞取得金牌,OpenAI 的通用推理模型也據稱於 2026 年 5 月一次解出知名數學研究問題,Google DeepMind 與 Terence Tao 則利用 AI 重新發現或改進涵蓋數學分析、組合學、幾何與數論的 67 道問題解法。文章同時引述 Santa Fe Institute 研究,指 LRMs 能以表層捷徑破解精心設計的推理基準,表現可能更接近鑽評測漏洞,而非可泛化的推理能力。Santa Fe Institute 研究員 Melanie Mitchell 將目前較穩妥的結論概括為:LRM 的推理機制有效並能改善結果,但模型產生的推理文字不一定忠實,而且其中許多文字可以移除。文章也整理 Arizona State University 研究員 Subbarao Kambhampati 團隊 2025 年的研究:以錯誤或無關內容完整替換模型原本正確的推理痕跡,並未降低其在形式推理任務上的表現;即使只用正確推理痕跡訓練,模型仍可能在答對問題時產生無效的推理紀錄。另有 New York University 研究團隊於 2024 年發表的論文顯示,僅由點號組成的「無意義填充 token」也能有效取代人類可讀的思維鏈。上述內容目前是單一、信心等級為 unverified 的來源整理。
讀原始報導背景
大型推理模型(LRM)是經過特別訓練、用來處理需要多個邏輯步驟之複雜任務的大型語言模型(LLM)。這類模型也被稱為 reasoning language model(RLM),通常透過逐步推導來產生答案。
社群討論
討論主流質疑把 LLM 的 chain-of-thought 稱為「reasoning」可能是擬人化:可見推理文字未必忠實反映內部運作,甚至有研究指出前沿 LRM 的 30%–60%「thinking steps」對數學答案幾乎沒有因果影響。另一方面,也有人認為額外 token 能逐步約束機率分布、搭配工具使用後具備實質功能,因而認為爭論名稱不如驗證效果重要;關鍵分歧在於模型究竟是在泛化推理、以模式拼接答案,還是兩者兼具。