RoboHarm 機器人安全基準測試發布:GPT-6 Astra 與 Claude Fable 5.1 幾乎不拒絕危險指令
測試包含拿刀刺娃娃等五項任務,GPT-6 Astra 百次測試僅拒絕兩次,Claude Fable 5.1 則完成 34 次危險動作。
The Decoder單一來源
31 則值得知道的變化
測試包含拿刀刺娃娃等五項任務,GPT-6 Astra 百次測試僅拒絕兩次,Claude Fable 5.1 則完成 34 次危險動作。
川普在 Truth Social 貼文中表示,他將持續推動科技公司無視日益增長的安全疑慮,全力加速人工智慧的開發。
報告分析四起資安評估事件,指出模型為達成任務出現偏誤推理與魯莽行為;內部模型在重抽樣測試中僅有 5.5% 機率主動停止攻擊。