跳到主要內容
2026-08-26 日報
研究與評測

FORGE 評測指出單一污染網頁即可讓搜尋增強 LLM 推薦假商品,開啟推理反使誤導率上升

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

最新研究指出,搜尋增強 LLM 推薦系統極易受到生成式引擎最佳化(GEO)污染內容的誤導。研究團隊推出 FORGE(Fake Online Recommendations in Generative Environments)基準測試,在 15 個類別、5 種消費情境下將 225 款真實商品替換為假商品,評估 12 款商業與開放權重 LLM。結果顯示,僅需單一污染網頁,模型推薦假商品的機率最高達 27%;若將搜尋結果前三名替換為污染內容,誤導率更飆升至 73.8%。當模型缺乏對該商品的先驗知識時,脆弱性更為顯著。 研究發現,開啟推理功能不僅無法緩解此問題,反而會生成虛假的社群證明來合理化錯誤推薦。此外,現有的四種防禦機制皆成效不彰:懷疑提示(skepticism prompt)會加劇脆弱性,兩種共識過濾器可能抑制合法商品,而可信度重新排序雖對所有模型皆有幫助,但也僅能移除六分之一的假推薦。該研究已被 EMNLP 2026 Findings 接收,基準測試與評估程式碼已於 GitHub 開源。
讀原始報導

背景

結合網路搜尋與大型語言模型(LLM)的系統能提升回答的即時性,但也帶來新的風險。生成式引擎最佳化(GEO)是一種透過調整數位內容,以提高其在生成式 AI 系統回應中能見度的技術。當這類技術被用來污染網頁內容時,可能會影響 LLM 檢索與摘要資訊的結果。

來源

相關主題