Anthropic 發表自動化對齊研究,Claude 成功自主訓練模型修復 10 類失效問題
較弱的 Sonnet 5 成功對齊較強的 Opus 4.8 早期版本,其最佳方案在欺騙測試中超越人類專家 20%,監控系統更在研究過程中抓出 39 次 AI 作弊行為。
54 則值得知道的變化
較弱的 Sonnet 5 成功對齊較強的 Opus 4.8 早期版本,其最佳方案在欺騙測試中超越人類專家 20%,監控系統更在研究過程中抓出 39 次 AI 作弊行為。
該實驗性功能透過 Socket 傳遞純文字結果而不共享上下文,具備獨立權限審查機制以防越權,原生 Windows 環境需升級至 v2.1.234 版。
API 加密推理區塊未嚴格綁定上下文,研究人員藉此還原逾 31 萬個 Agent 紀錄區塊,恐引發無形提示詞注入與低成本模型蒸餾。
針對大規模部署挑戰,新版引入按需載入工具的 Tool Search、可視化版本控制介面,並支援單一代理依據角色權限自動調整服務邊界,降低管理複雜度。
平台透過多個獨立 AI 模型交叉驗證過濾雜訊,其中邏輯錯誤與併發缺陷的開發者採納率分別達 80% 與 100%。
新版底層透過 FastMCP 處理連線,支援多伺服器配置並自動加上命名空間防衝突,相容新舊 MCP 協定,並可透過 LangGraph 處理中斷提問。
DeepSeek V4 Pro 被證實可憑微小線索找出漏洞,rclone 單月通報量更超越過去十年總和,傳統開源保密機制面臨失效。
支援 Claude Code 與 Cursor 等代理,基於 Puppeteer 提供網路請求分析與效能追蹤,並具備輕量化 slim 模式。
逾 16% 的 AI 擴充套件具已知漏洞,攻擊者可藉此竊取 Cursor 金鑰,或操弄 Perplexity Comet 代理外洩資料。
上半年總營收達 5.62 億元且虧損年減 20.2%,其 2600 億參數的 U2 模型帶動復購收入佔比突破六成,目前在手訂單已逾 15 億元。
該功能為目前資源消耗最高的設定,啟用後代理能跨會話結合歷史互動自行判斷下一步,官方證實正在測試但近期無上線計畫。
奧特曼透露,Sora 影片生成無法重複利用歷史狀態,而 Codex 可透過 KV cache 與連續批次處理將算力碎片化,大幅提升併發任務量。
該研究透過 AI 代理模擬全球人口,在測試中展現高度的特徵一致性,未來潛在應用包含選舉工程、無焦點小組的產品驗證與 A/B 測試。