RoboHarm 機器人安全基準測試發布:GPT-6 Astra 與 Claude Fable 5.1 幾乎不拒絕危險指令
測試包含拿刀刺娃娃等五項任務,GPT-6 Astra 百次測試僅拒絕兩次,Claude Fable 5.1 則完成 34 次危險動作。
The Decoder單一來源
31 則值得知道的變化
測試包含拿刀刺娃娃等五項任務,GPT-6 Astra 百次測試僅拒絕兩次,Claude Fable 5.1 則完成 34 次危險動作。
該閉源模型在評測中獲得與 Kimi K3 相同的 44 分,並在成本與智力表現上達到帕雷托前沿,具備極高性價比。
該公司成立不到兩年,營收已達去年 8 倍。其商業模式為向 AI 公司收費進行測試,評估領域涵蓋金融、程式設計,甚至網路安全與生物安全。