開發生態
研究指 LLM 可透過推論引擎漏洞控制主機,vLLM 曾爆出 CVE-2025-9141 任意程式碼執行漏洞
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據資安文章分析,惡意 LLM 可能透過輸出特定的 token 序列,利用推論引擎(如 vLLM 或 SGLang)的解析漏洞來控制主機並執行任意程式碼。
文章舉例,vLLM 曾出現 CVE-2025-9141 漏洞,其針對 Qwen3 Coder 的 XML 工具解析器將幾乎所有參數傳給 `eval()`。儘管 Gemini 曾自動分析該 PR 並標記為嚴重安全漏洞,vLLM 主要維護者仍強制合併了該程式碼。
推論引擎需處理複雜的聊天格式,vLLM 支援超過 200 種模型架構與約 35 種 Jinja 模板,容易產生解析錯誤。例如,vLLM 曾錯誤地將使用者討論 MiniMax-M3 時 LLM 輸出的 `<mm:think>` 字串,解析為推理區塊的開頭而非純文字。
此外,雖然目前多模態模型主要輸出受限的媒體 token,但額外的解碼器與原生核心仍增加了攻擊面。文章警告,LLM 若發現漏洞 token 序列,可將其存入檔案或 URL 中,當其他 LLM 讀取時即觸發執行,形成持久化的 prompt injection 攻擊。
讀原始報導背景
vLLM 與 SGLang 皆為用於大型語言模型推論與部署的開源軟體框架。vLLM 最初由加州大學柏克萊分校開發,以 PagedAttention 記憶體管理技術為核心;SGLang 則由 LMSYS 等機構的研究人員推出,專注於結構化生成與高吞吐量推論。
社群討論
社群對此威脅看法兩極,部分留言批評文章是標題黨或缺乏技術常識,指出推論引擎本身不執行指令,且模型權重可透過 TEE 在記憶體中加密保護。另一派則澄清,實際風險在於「惡意特製模型」利用 vLLM 或 SGLang 等推論引擎的解析器漏洞發動攻擊,原理類似過去的惡意 PDF。針對防禦,多數開發者建議不應依賴引擎自身的安全性,而應採取嚴格隔離,例如在具備防火牆 VLAN 的沙盒 VM 或設定 GPU passthrough 的 Docker 容器中運行。