研究與評測
研究指出 SynthID-Text 浮水印會引發「取樣漂移」,使 LLM 更易受提示注入攻擊
Ars Technica AI單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Lasso Security 研究員 Andrea Siposova 的最新測試指出,Google 開源的 AI 文本浮水印技術 SynthID-Text 會改變 LLM 的安全行為,使其更容易受到提示注入(prompt injection)攻擊。
SynthID-Text 透過密鑰與「錦標賽取樣(tournament sampling)」機制,在模型選擇下一個詞彙時改變機率分數以嵌入來源標記。研究員透過 Hugging Face 的實作版本測試六款開放權重模型,比較啟用與未啟用浮水印的差異。結果顯示,浮水印不僅改變詞彙選擇,還會影響 AI 代理呼叫工具的決策與傳遞的參數,研究將此效應稱為「取樣漂移(sampling drift)」。
實驗發現,在面對單純的有害請求或結合提示注入技術時,啟用浮水印的模型比未啟用時更容易給出原本會觸發安全護欄而拒絕的有害回應。此外,使用不同的密鑰也會導致模型產生不同的行為變化。
該研究目前僅針對六款開放權重模型及 Hugging Face 實作版本進行測試,並未涵蓋 Anthropic 未來 Claude 模型將採用的具體實作。研究強調,由於浮水印會改變底層的拒絕行為與工具呼叫,開發者在部署此類機制後,必須針對模型與 AI 代理重新進行紅隊測試。
讀原始報導