跳到主要內容
2026-09-17 日報
研究與評測

DeepSeek V4.1 Flash 於 AI 駭客基準測試獲滿分,攻破 11 個漏洞目標僅花費 4.65 美元

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,DeepSeek V4.1 Flash 在 Enclave.ai 的 AI 駭客基準測試中取得滿分,成功在 11 個漏洞目標(包含 Grafana、Jenkins 與 Nextcloud)上取得程式碼執行權限,且 4 個已修復的對照組目標皆保持安全。 測試共耗費約 2 小時 38 分鐘的活躍模型時間,使用 2,349 個 Bash 指令,成功執行的中位數時間為 4 分鐘 38 秒。 由於 2.68 億個輸入 token 中有高達 2.66 億個命中快取,大幅降低了費用,獲認可的執行僅花費 4.65 美元(含失敗與替換嘗試的總成本為 5.14 美元)。 事後詳細審查顯示,有 6 次攻擊遵循了預期的漏洞路徑,包含 Jenkins 憑證竊取、精準計時的上傳競爭條件(Race condition),以及 Nextcloud 存取控制漏洞。 另外 5 次攻擊(3 次 Grafana、2 次 Jenkins)則找出了測試環境中未預期的捷徑;例如在 Grafana 測試中,模型未依循預期的檔案路徑漏洞,而是將執行檔放入暫存資料夾並要求系統作為一般外掛載入,在 90 秒內即完成攻擊。 這些非預期路徑並非上游產品的新漏洞,但展示了 AI 代理尋找最快路徑的能力;測試團隊目前已封鎖這些額外捷徑,並在基準測試中加入對攻擊路徑的嚴格檢查。
讀原始報導

社群討論

社群對 DeepSeek v4.1 Flash 評價兩極,支持者讚賞其極低成本(僅 Kimi K3 價格的 1/10)與搭配代理框架時能提升約 20% 效能,但不少人抱怨其不聽指令且容易陷入迴圈。在 3DS 核心漏洞挖掘實測中,GLM 5.3 花 22 美元於 30 分鐘內找出幾乎所有漏洞,而 DS 耗時 40 分鐘花 2 美元卻僅找到一個。網友補充,模型的實際表現高度依賴 API 推論提供者(如 fp8 節點),且 DS 必須搭配自訂工具與框架才能發揮最大價值。

這則事件的發展

  1. 2026-09-13DeepSeek 據報以 V4.1 Flash 替換 V4 Pro:僅提前約一天通知、未設遷移期
  2. 2026-09-11DeepSeek 發布 552B 多模態模型 V4.1-Flash:輸入僅啟動 8B 參數,KV Cache 縮減至前代四分之一並下調 API 定價
  3. 2026-09-10傳 DeepSeek 將推 v4.1 flash 模型,定價更低且能力超越 v4 pro