跳到主要內容
2026-09-13 日報
研究與評測

KAIST 與 Naver AI Lab 研究發現 AI 推理步驟對應獨立內部表示,中間層訊號最強

The Decoder單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,韓國 KAIST 與 Naver AI Lab 的最新研究指出,語言模型在文本輸出的推理步驟,可與其內部的數值表示明確對應。研究團隊定義了提取、分解、公式回憶、推演與計算等 8 種推理操作,讓 Qwen2.5-7B、Qwen3-8B 與 Gemma4-31B 解決數學問題,並使用 GPT-5 對解答路徑進行分段標註。 測試顯示,不同的推理操作在模型內部表示中可被可靠區分,且分離現象在中間層達到高峰。此現象並非單純由表面用詞或位置引起;例如「a」或「is」等常見詞彙,在早期層的表示混合在一起,但在中後層會根據所屬的推理步驟產生不同的內部表示。 研究發現推理步驟並非孤立形成,若透過介入阻斷對前 30 個 token 的注意力,該操作的訊號便會削弱。此外,即使模型最終解答錯誤,其內部表示依然能準確辨識出當下正在執行的步驟類型(如計算或推演)。 此可分離性在 Llama-3-8B 上成功複製,且針對 Qwen3-8B 訓練的分類器能成功轉移至 GPQA-Diamond 與 MATH-500 評測基準。報導指出,此發現對 AI 安全與監督具重要意義,特別是當前如 OpenAI Astra 的 Recurrent Depth 技術將部分推理轉移至內部數值表示,或如 Claude Opus 4.6 實際處理的資訊多於其輸出的推理步驟時,理解內部表示有助於提升模型可解釋性。
讀原始報導
本期分類