研究與評測
Anthropic 發表自動化對齊研究,Claude 成功自主訓練模型修復 10 類失效問題
Anthropic 官網綜合 2 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Anthropic 發表名為《Automated Researchers Can Reliably Mitigate Alignment Failures》的新研究報告,展示如何利用 Claude 作為自動化研究員,自主訓練「學生」模型以解決 AI 對齊(Alignment)問題。該專案由 Anthropic 研究員 Chen Yueh-Han 領導。
在實驗中,Claude 針對 10 類對齊失效問題(如欺騙、阿諛奉承、越獄,以及由 ConfAIde、PrivaCI-Bench 與 PrivacyLens 測量的隱私侵犯等),透過「搜尋文獻、提出方法與資料、訓練、測試」的迴圈進行自主修復。為確保修復品質,系統設有監控代理(monitoring agent)審查 Claude 提出的方法,禁止其直接將自身的對齊能力蒸餾至目標模型中,並排除會損害模型通用能力的方法。
研究以「安全差距縮小百分比」評估表現。結果顯示,Claude 成功為全數 10 類失效問題找到修復方法,在提升目標基準測試表現的同時,並未降低模型的整體效能。此外,這些修復方法具備良好的泛化能力,不僅在 Claude 未曾見過的保留基準測試與開源測試工具 Petri(模擬對抗性多輪情境)上依然有效,甚至能適用於體積達 Claude 最佳化目標 4.7 倍的大型模型。
讀原始報導背景
隨著 AI 系統逐漸具備自我建構能力,將確保模型安全的「對齊(Alignment)」研究自動化,已成為技術發展的重要關鍵。為了量化模型在隱私外洩或欺騙等方面的失效風險,研究人員開發了如 ConfAIde 等基準測試工具,藉此評估大型語言模型(LLM)的安全性。
來源
- TechCrunch AItechcrunch.com
- Reddit r/singularityreddit.com
- github.com