跳到主要內容
2026-08-29 日報
研究與評測

GPT、Claude 與 Gemini API 爆隱藏推理外洩漏洞:可透過同廠低階模型跨模型讀取,還原出密碼與金鑰

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,X 用戶 @kotekjedi_ml 與研究團隊發現 Claude、GPT 和 Gemini API 存在隱藏推理(reasoning)外洩漏洞,可將原本不向用戶展示的加密推理區塊還原為可讀文本。 為支援長任務與 Agent 狀態恢復,API 會將內部推理封裝成加密的不透明區塊(opaque block)交由客戶端保存。漏洞在於系統僅驗證資料未被篡改,卻未嚴格綁定當前模型與會話(context binding)。研究人員利用跨模型相容性(cross-model compatibility),將強模型(如 Claude Opus)生成的 reasoning 區塊放入同廠較易繞過的低階模型(如 Haiku)上下文中,讓後者將內容轉錄出來。 實測顯示,Anthropic、OpenAI 和 Google 模型的恢復文本長度與 API 紀錄的 hidden thinking token 數高度對應。研究團隊從 GitHub 與 Hugging Face 收集 6,708 條公開 Agent 運行紀錄,成功還原 315,320 個 reasoning block,並從中發現未出現在公開對話中的 API key、密碼、私鑰與內部技術資訊。 此漏洞恐引發兩大風險: - 低成本模型蒸餾:提取方可利用低成本模型讀取高階模型的 encrypted reasoning。實驗顯示,僅將 Opus reasoning 開頭約 1% 的 token 放入 Kimi K3 的上下文,Kimi K3 的回答方向即明顯向 Opus 靠攏。 - 無形提示詞注入(invisible prompt injection):惡意內容可隱藏在 reasoning 中,當 Agent 重新載入該狀態時會受影響並執行額外動作,且能繞過針對明文的傳統安全掃描。
讀原始報導

背景

生成式 AI 模型通常透過提示工程(Prompt engineering)與上下文工程來管理系統指令、API token 等資訊以產出特定結果。然而,近期研究人員發現 GPT、Claude 等主流模型在處理複雜任務時,其隱藏的思維鏈(Chain-of-Thought)推理過程因上下文綁定不嚴格,存在被其他相容模型讀取並外洩的風險。

來源

相關主題