跳到主要內容
2026-08-13 日報
研究與評測

Google Research 發布 WikiProfile 評測:GPT-5 與 Gemini 3 已編碼 95% 事實,但仍有近三成無法直接提取

Google Research一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Google Research 發布「知識分析(Knowledge profiling)」框架與 WikiProfile 評測基準,指出大型語言模型的事實性錯誤主要源於「提取失敗(Recall failures)」,而非「未編碼(Encoding failures)」。 研究團隊建構了包含 2,150 個維基百科事實的 WikiProfile 評測基準,並針對 Gemini-3-Pro、Gemini-3-Flash、GPT-5 及 Gemma 3 系列等 13 款模型進行測試,共產生約 450 萬筆回應。 測試結果顯示,Gemini-3-Pro 與 GPT-5 等前沿模型已將 95% 至 98% 的事實編碼至參數中,但仍有 26% 至 34% 的事實無法被直接提取。即使啟用「思考(Thinking)」模式,這些前沿模型仍會在 11% 至 12% 的事實上提取失敗。 在 Gemma 3 系列的測試中發現,擴展模型規模能大幅減少編碼失敗的比例,但提取失敗的比例依然居高不下。這表明前沿模型的瓶頸已從知識獲取轉移至知識利用。
讀原始報導

背景

大型語言模型(LLM)在回答事實性問題時常會出錯,但傳統的準確率指標無法區分模型是「從未學習過該知識」還是「無法提取已儲存的知識」。釐清這兩種錯誤的根源,有助於開發者決定該透過擴充訓練資料,或是利用推論期的技術來改善模型的表現。

來源

本期分類