跳到主要內容
2026-08-12 日報
研究與評測

研究破解 OpenAI、Anthropic 與 Google 加密推理過程:將前沿模型軌跡輸入同廠較弱模型即可還原明文

Techmeme綜合 3 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

研究人員發表最新論文(arXiv:2608.09867),揭露一種可從 Claude、GPT 與 Gemini 提取隱藏「推理軌跡(reasoning traces)」的漏洞。由於 Anthropic、OpenAI 與 Google 會向客戶端回傳加密的思維鏈(chain-of-thought)區塊,且這些區塊允許跨工作階段、使用者與模型重播。研究團隊藉由將前沿模型產生的加密軌跡輸入至同廠的較弱模型中,再對較弱模型進行越獄(jailbreak),即可成功還原出強大模型的隱藏推理明文。開發者實測指出,透過呼叫 OpenAI 的 `gpt-5.6-luna` 模型 API 即可觀察到此加密區塊機制;開源社群則呼籲在官方修補此漏洞前,盡快收集 Opus 5 等前沿模型的推理資料集。
讀原始報導

背景

前沿模型(Frontier models)是目前最先進的通用型人工智慧模型,具備推理、多模態生成與代理工作流程等能力。這類模型通常透過龐大的資料集進行訓練,可廣泛應用於大型語言模型(LLM)等各種生成式 AI 領域。

來源

本期分類