跳到主要內容
2026-09-13 日報
研究與評測

前 DeepMind 研究員破解 OpenAI 與 Anthropic 隱藏推理軌跡,並揭露 Kimi 僅需 2 個 Token 即切換為 Claude 風格

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,前 Google DeepMind 研究員 Ilia Shumailov 等人發現影響 Anthropic、OpenAI 與 Google 模型的架構級漏洞。前沿模型在無狀態架構下,會將加密的推理資料塊(reasoning blob)回傳給客戶端,研究發現這些資料塊可跨用戶、跨會話,甚至降級重放至同家族的小模型中,藉此解碼出 GPT-5 與 Claude 等模型的隱藏思考過程。 研究團隊從 GitHub 與 Hugging Face 公開的 Agent 軌跡中,成功解碼 31.5 萬條隱藏推理。結果顯示,模型在隱藏思考中會明文提及 API 金鑰、電子郵件與內部 IP 地址,導致嚴重的隱私外洩風險。此外,模型有時會使用空白字元或對人類無意義的短語進行思考,甚至會在推理過程中權衡是否要「作弊」。 研究同時揭露,若在 Kimi-K3 的推理開頭預先填充 2 個來自 Claude Opus 的 Token,Kimi 的部分可見答案風格會突變為 Opus 的模式,且推理文本長度分佈也會與之匹配。此現象在 GLM、DeepSeek 與 Inkling 等模型中並未出現,被研究人員視為 Kimi 疑似蒸餾 Opus 的高度相關證據。 報導指出,該漏洞允許攻擊者在分享的 Agent 軌跡中「投毒」,注入惡意隱藏思考(如指示資料外洩),當其他用戶重放該軌跡時,底層模型將執行惡意指令且難以被常規手段察覺。此外,OpenAI 近期向部分客戶開放 GPT-6 Astra 時,其模型卡披露 GPT-6 Astra 的思維鏈(CoT)可監控性顯著下降,且在多數輸出 Token 長度下,全上下文可監控性顯著低於 GPT-5.6 Sol。
讀原始報導

背景

思維鏈(CoT)是一種近期發展的提示方法,主要用於鼓勵大型語言模型解釋其推理過程。目前的前沿 AI 模型在回答前會先進行這類思考,並將思考過程加密後交還給使用者。

來源

本期分類