跳到主要內容
2026-09-09 日報
研究與評測

Hugging Face 發表 LLM 安全拒絕邊界研究,指出傳統微調恐致 Qwen3-8B 過度拒絕率飆升至 74%

HuggingFace Blog一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Hugging Face 發表新論文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,探討 LLM 在特定部署情境下,如何精準拒絕主題中的有害子集(如政治操弄),同時保留回答同主題安全問題(如政治事實)的能力。 研究指出,傳統自我生成安全微調(如 ThinkSafe)存在三大弱點。首先是覆蓋率缺口,單次引導生成會丟棄約 19.88%(8,009 個)的困難樣本,研究團隊透過漸進式重試策略將失敗率降至 0.20%(79 個)。其次,模型易對看似危險的安全提示產生錯誤拒絕,為此團隊引入 11,955 個具備危險字眼的安全提示進行訓練。最後,傳統指標無法測量邊界,團隊改用 1,539 組僅意圖不同的有害與安全提示對進行直接測量。 實驗顯示,在 Qwen3-8B 模型上,新方法將分佈內政治拒絕率從 9.47% 提升至 84.75%,並在 HarmBench、StrongREJECT 與 WildJailbreak 等三大基準測試中,將不安全回應率從 26.26% 降至 0.14%。 然而研究警告,若僅追求降低有害回應,會導致嚴重的過度拒絕(Over-refusal)。在最強配置下,Qwen3-8B 在 XSTest 的過度拒絕率從 2.00% 飆升至 74.00%,形同盲目的「拒絕機器」。透過將外部合規回應替換為目標模型自行生成的驗證回應,可在單次生成下將過度拒絕率從 15.20% 降至 5.20%,強調安全性與過度拒絕指標必須合併評估。
讀原始報導
本期分類