跳到主要內容
2026-09-28 日報
研究與評測

論文指出聊天模板是觸發 LLM「我只是個 AI」聲明的關鍵,並可透過啟動空間控制

Hacker News單一來源
核實資料不足

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

本次未取得足夠原文證據

據一篇提交至 arXiv 的論文指出,大型語言模型(LLM)常見的「我只是個 AI」免責聲明,主要受到聊天模板(chat template)的控制。研究團隊測試 8 款參數規模 9B 以下的開源指令模型(instruct models),發現聊天模板如同開關:存在時會增強免責聲明並壓抑「我感覺」等體驗式語氣;移除時則結果相反。此外,研究在其中 3 款模型的啟動空間(activation space)中找到控制此行為的特定方向。在沒有聊天模板的模型中加入該方向,即可重現免責聲明;移除該方向則會減少聲明,而隨機加入同等大小的方向則無此效果。研究結論強調,模型對自身的描述並非單純來自權重,而是部分由聊天模板決定,在 AI 安全與自我認知研究中,不應將模型的自述視為字面事實。
讀原始報導

社群討論

社群對 LLM 常用的「As a Language Model...」免責聲明感到厭煩,但有留言引述《Nature》研究指出,LLM 在醫療建議上有高達 50% 的錯誤率,凸顯企業避險的必要性。許多人認為模型的第一人稱語氣純粹來自微調或系統提示詞,但論文作者澄清,即使是未經 RLHF 的基礎模型也會自然產生這種「體驗式」語氣。此外,針對模型擬人化,有人批評這是操縱性的暗黑模式(dark pattern),但也有反方認為這僅是訓練人類語料的自然產物。

本期分類
相關主題