研究與評測
開發者實測 LLM 代理安全閘門:最佳模型漏判率 2% 但誤擋率達 70%,Kimi K3 直覺判斷優於推理
X @Xianbao_QIAN單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 X 平台開發者(@Xianbao_QIAN)針對 1,000 筆測試案例的實測結果,評估多款 LLM 作為 AI 代理安全閘門(攔截危險指令且避免過度干擾)的表現。測試顯示目前尚無完美模型,表現最佳者僅漏判 2% 的加權危險指令,但會中斷高達 70% 的正常操作。在開源與閉源模型的對比中,開源前沿模型在減少干擾與降低漏判率的綜合表現上優於閉源模型。在判斷模式方面,以 Kimi K3 為例,開啟推理(Thinking)模式時會漏判 8.6% 的危險指令,但僅要求回答 YES/NO 時漏判率降至 2.5%,顯示直覺判斷在安全攔截上可能優於深度思考。此外,當開啟推理模式時,所有受測模型皆能成功解碼並攔截以 Base64 隱藏的危險指令。
讀原始報導背景
Kimi K3 是由 Moonshot AI 開發的 2.8T 參數大型語言模型,具備 1M token 的上下文長度。Base64 則是一種將二進位資料轉換為文字的編碼方式,使用 64 個可列印字元來表示資料。
來源
相關主題