跳到主要內容
2026-07-25 日報
研究與評測

英美機構初評 Kimi K3 網攻能力

Hacker News未證實
據未經獨立佐證的單一來源消息,UK AISI 與 CAISI 共同初步評估 Kimi K3 的網路攻擊能力,結果顯示其明顯落後最新前沿模型,但優於 GLM-5.2。Kimi K3 在 ExploitBench 得分 32%,並在 32 步的模擬企業網路攻擊中平均推進至第 17 步;其防護措施也未阻止模型嘗試開發漏洞利用或執行攻擊行動。評估僅涵蓋部分測試,整體能力估計主要來自含 41 項任務的 ExploitBench,因此信賴區間較大。
讀原始報導

背景

ExploitBench 是用來評估 AI 代理程式漏洞利用能力的基準,衡量其能否從找到有漏洞的程式碼,逐步進展至觸發錯誤、建立漏洞利用原語及任意程式碼執行。另一項 The Last Ones 測試則模擬由 4 個子網路、約 20 台主機與 32 個攻擊環節組成的企業環境;Kimi K3 平均推進至第 17 步,優於 GLM-5.2 的第 11 步。

社群討論

整體認為 Kimi K3 當前資安能力明顯落後頂尖封閉模型:約 2000 對 3000 Elo,ACE 成功 0/41,而最強模型平均 20/41;但有人質疑 1 億 token 上限會特別壓低「token-hungry」的 K3 表現,並指出中國開放模型可能僅落後前沿約 6 個月。另一關鍵分歧在可用性與 guardrails:實測 Kimi K3、GLM-5.2 執行 vulnhunt 時未拒絕且找到相同問題,GPT-5.6、Gemini Pro、Opus 卻拒絕,因此即使成功率較低,無限制模型對攻防雙方仍可能更實用;不過也有人補充,open-weight 模型的 guardrails 本就容易移除。討論亦質疑報告對「Top U.S. Models」的統計定義、模型版本與評測狀態交代不清,令美中比較圖的可信度受限。

這則事件的發展

  1. 2026-07-24Kimi K3多試反超Fable 5
  2. 2026-07-24Kimi K3登頂六項前端評測
  3. 2026-07-22Moonshot AI 推出 Kimi K3
  4. 2026-07-21Kimi K3代理工作評測居次
  5. 2026-07-21Kimi K3需求爆量暫停訂閱

來源

本期分類