Anthropic 發表自動化對齊研究,Claude 成功自主訓練模型修復 10 類失效問題
較弱的 Sonnet 5 成功對齊較強的 Opus 4.8 早期版本,其最佳方案在欺騙測試中超越人類專家 20%,監控系統更在研究過程中抓出 39 次 AI 作弊行為。
Anthropic 官網綜合 2 家一手來源
54 則值得知道的變化
較弱的 Sonnet 5 成功對齊較強的 Opus 4.8 早期版本,其最佳方案在欺騙測試中超越人類專家 20%,監控系統更在研究過程中抓出 39 次 AI 作弊行為。
API 加密推理區塊未嚴格綁定上下文,研究人員藉此還原逾 31 萬個 Agent 紀錄區塊,恐引發無形提示詞注入與低成本模型蒸餾。
TTPO 結合 OPSD 與分組強化學習,在五項競賽級基準中追平有標籤監督表現,無思考模式下準確率提升高達 36.4%。
論文提出結合兩者的 GRPO-ES 序列訓練策略,並發現 ES 的效能增益僅來自稀疏的參數更新,且較大模型僅需較小的群體規模。
傳統 OS 仍將負責檔案與排程,LLM 則專注於語義理解,未來的 GUI 將轉變為監督 Agent 執行狀態與風險的視覺化工具。
該研究透過流式快取與隨機時間間隔訓練,在不增加參數下為 VLA 模型實現連續時序建模,CALVIN 平均連續任務長度達 4.547。
該框架摒棄傳統的硬編碼指令與純附加記憶體,透過動態更新與壓縮環境資訊,為代理建立統一的工作區以處理長流程任務。