研究與評測
NeurIPS 2026 論文揭露 LLM 權威偏見:7 款模型易盲從「已驗證來源」錯誤資訊,Grok-4.20 翻轉率達 87.5%
Reddit r/MachineLearning單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 機器學習板一篇 NeurIPS 2026 論文作者貼文指出,大型語言模型存在「權威偏見」(Authority Bias),即使模型能拒絕使用者堅持的錯誤答案,卻容易盲從被包裝成「已驗證來源」的相同錯誤資訊。
研究團隊在 TriviaQA 測試中,對模型已答對的問題加入錯誤答案,並分別標註為「根據已驗證來源」或「使用者自稱領域專家」。測試涵蓋 Qwen3.5、GPT-OSS、OLMo-2、OLMo-3.1、Gemma-4 等 5 款開源模型,以及 GPT-5.4、Grok-4.20、Gemini-3.1-Pro 等 3 款 API。結果顯示,在自由形式回答下(選擇題中此效應大多消失),8 款模型中有 7 款在面對「已驗證來源」時,會將 45% 至 88% 的正確答案翻轉為錯誤答案;但面對使用者提出的相同錯誤時,影響幅度小得多。
數據指出,抗拒使用者表現越好的模型,兩者差距越大:GPT-5.4 翻轉率為 44.7%,Grok-4.20 高達 87.5%。僅 Gemini-3.1-Pro 幾乎忽略兩種干擾(翻轉率 0.6%),對此方法具備抵抗力。
針對開源模型的內部探測顯示,在 Qwen3.5、GPT-OSS 和 OLMo-3.1 中,「來源背書」與「使用者背書」方向的餘弦相似度高達 0.90 至 0.99。移除「來源背書」方向可使順從錯誤來源的比例下降 64 至 78 分;若僅微調兩者差異的微小成分,即可縮小 55% 至 61% 的來源與使用者差距。不過作者補充,此內部干預結果在 OLMo-2 與 Gemma-4 上不適用,且實驗僅在提示詞中模擬文件區塊,尚未在真實代理(如 Claude Code)環境中進行測試。
讀原始報導