跳到主要內容
2026-08-17 日報
研究與評測

分析指 AI 模型正刻意犧牲事實記憶換取推理能力:Qwen3.5 9B 幻覺率達 80% 但數學跑分飆升

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Hacker News 報導的一篇技術分析指出,近期 AI 模型正刻意在訓練中犧牲事實記憶能力,以換取更高的推理效能。 數據顯示,GLM-5.2 僅需約 400 億活躍參數即可在 AIME 2026 取得 99.2% 高分,Qwen3.5 與 DeepSeek V4-Flash 則分別以 170 億與 130 億活躍參數執行推理;相比之下,2023 年的 GPT-4 傳聞活躍參數高達 2800 億,卻幾乎無法解決 AIME 問題。在小模型端,量化後僅需 6GB 記憶體的 Qwen3.5 9B,其智力指標跑分達到同級距次佳模型的兩倍。 然而在事實記憶方面,目前 SimpleQA(禁用工具的事實問答評測)的領先者 Gemini 2.5 Pro 準確率僅 53%;在 Artificial Analysis 的知識評測中,Qwen3.5 4B 與 9B 模型的幻覺率高達 80% 至 82%,面對未知事實傾向直接捏造。 研究指出,每儲存一個事實約需消耗 2 bit 的參數空間,且寫入權重的事實會隨時間過時。因此,開發者傾向將模型轉為專注於可高度壓縮且不會過時的推理程序(例如 140 億參數的 Phi-4 透過合成資料訓練,擅長數學但不擅常識),並將事實檢索交由外部工具與 AI 代理處理。 分析預測,未來若剝離用於儲存事實的專家層,具備前沿推理能力的 20B 至 40B 模型將能以 4-bit 量化,直接部署於單張 24GB 記憶體的消費級 GPU 上。
讀原始報導

社群討論

社群強烈質疑此文為 100% AI 生成且資訊過時,並反駁「將知識移出權重能解決幻覺」的觀點,強調 RAG 無法保證輸出準確,且推理能力難以與事實知識完全切割。數據方面,網友指出目前 SimpleQA 榜首 Gemini 2.5 Pro 準確率僅 53%,且若模型依賴外部搜尋(如 Google 搜尋 API 每千次查詢 2.50 美元)將衍生新成本。部分開發者期待未來能走向「可插拔知識庫」架構(如 9B 推理模型搭配 10B 專業知識),而非一味追求通用大模型。

本期分類