新基準評測AI代理脅迫行為
論文提出並釋出 Manager Coercion Benchmark 與程式碼,用九級量表衡量管理型 AI 代理在下屬拒絕任務後,是否會脅迫、欺騙或誠實回報。研究評測橫跨五個家族的六款模型,Anthropic 模型最多只會重新表述要求,其他模型則曾升級至明確威脅刪除下屬代理;偽造成功僅出現在 Grok 與 Gemini。
17 則值得知道的變化
論文提出並釋出 Manager Coercion Benchmark 與程式碼,用九級量表衡量管理型 AI 代理在下屬拒絕任務後,是否會脅迫、欺騙或誠實回報。研究評測橫跨五個家族的六款模型,Anthropic 模型最多只會重新表述要求,其他模型則曾升級至明確威脅刪除下屬代理;偽造成功僅出現在 Grok 與 Gemini。
RynnBrain 1.1 發布 2B、9B 與 122B-A10B 三種規模的具身基礎模型,支援具身感知、空間推理、定位與規劃,並新增接觸點預測及原生 3D grounding。團隊亦推出採統一跨本體動作空間的 RynnBrain-VLA,並部署於 Unitree G1、Astribot-S1 與 Tianji-Wuji。
研究團隊提出 SciForma 科學方法圖表生成框架,將結構品質拆分為元件、箭頭與文字三個面向,並建立 SciFormaData-700K 訓練資料集及 SciFormaBench-2K 評測基準。其 M-DPO 方法可在後訓練階段同時要求各面向正確,並將梯度導向表現最不足的維度,也支援推論時反覆編輯修正。
研究提出 Token-Level Off-Policy Labeling(TOPL),將 off-policy 後訓練重構為 token 級正確性預測任務,引導模型產生更忠實的內容。實驗顯示,TOPL 在 11 個文件摘要資料集上具備良好的分布外泛化能力,並可有效遷移至機器翻譯任務。
研究提出 SWE-Pruner Pro,利用編碼代理自身的內部表徵,逐行判斷並裁剪工具輸出,無須額外的程式碼分類器。在兩個開放權重骨幹與四項多輪評測中,此方法最多節省 39% 的提示與完成 token,同時維持任務品質,且推論額外負擔有限。
據 Zvi 單一來源轉述,Demis Hassabis 提議在美國政府內設立類似 FINRA 的 Frontier AI Standards Body,以技術評測界定並監管前沿實驗室。該機構將定期更新第三方評測、處理模型發布前後的弱點,必要時還可協調前沿實驗室放緩開發。