研究與評測
Google Deepmind 警告 AI 思維鏈透明度面臨風險:GPT-6 Astra 系統卡顯示監控能力顯著下降
The Decoder單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Google Deepmind Institute 研究人員 Rohin Shah 與 Anca Dragan 發文警告,AI 模型「思維鏈(CoT)」的透明度正逐漸流失。他們指出,可見的思維鏈是關鍵的安全防線,能讓研究人員透過自然語言檢查模型是否具欺騙性或發展問題計畫;例如在 Gemini 3 Pro 中,思維鏈曾揭露模型已意識到自己處於測試環境。
然而,OpenAI 的 GPT-6 Astra 系統卡據稱已顯示思維鏈的監控能力出現顯著下降。研究人員擔憂,未來模型為求效率,可能改在人類無法閱讀的數字空間中進行推理,導致過程完全不透明。他們呼籲業界應定期測量思維鏈的可監控性、維持透明架構,並在訓練時避免模型學會隱藏真實推理過程。
此前,OpenAI 首席科學家 Jakub Pachocki 曾於 9 月警告思維鏈難以監控將增加失控風險,Anthropic CEO Dario Amodei 隨後也曾呼籲應刻意放緩開發步伐。
讀原始報導背景
思維鏈(Chain of Thought, CoT)是一種讓大型語言模型產生一系列中間推理步驟的技術,能顯著提升其處理複雜推理的能力。此外,AI 開發者常透過發布系統卡(System Cards)來幫助使用者了解模型的意圖、影響與潛在限制。