跳到主要內容
2026-09-28 日報
研究與評測

研究指出 LLM 蒸餾防禦存在漏洞:攻擊者透過後續強化學習即可輕易破解並竊取推理能力

HF Daily Papers一手來源
核實資料不足

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

本次未取得足夠原文證據

一項新研究指出,現有針對大型語言模型(LLM)蒸餾攻擊的防禦機制存在嚴重漏洞。目前的防禦評估通常僅在蒸餾完成後進行,假設攻擊者不會進一步訓練模型;然而研究表明,若攻擊者在蒸餾後加入強化學習(Reinforcement Learning),原本看似有效的防禦機制將輕易被破解。 研究顯示,強化學習大幅降低了有效蒸餾攻擊的門檻。攻擊者只需使用從現有 API 輕易取得的資料發動簡單攻擊,即可竊取閉源語言模型的推理能力,其推理能力的提升幅度,與提取完整隱藏軌跡的複雜攻擊相當。 研究團隊結論指出,任何會洩漏足夠資訊以重建近似推理軌跡的蒸餾防禦,都可能失去效用,並建議未來應朝向批次層級(batch-level)的蒸餾防禦發展以提高安全性。
讀原始報導

背景

知識蒸餾(Distillation)攻擊能讓攻擊者以較低成本複製閉源大型語言模型的推理能力。為了應對此威脅,如 Anthropic 等 AI 開發商正持續投入資源建立防禦機制,試圖增加這類攻擊的執行難度並提高偵測率。

來源

本期分類