研究與評測
Google Research 與 Technion 研究:GPT-5 等前沿模型透過延長思考時間,可恢復高達 65% 無法直接回憶的事實
VentureBeat單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 VentureBeat 報導,Google Research 與 Technion 的最新研究指出,大型語言模型(LLM)的幻覺通常並非缺乏知識,透過延長思考時間,前沿模型可恢復高達 65% 無法直接回憶的事實。
實驗顯示,GPT-5 與 Gemini-3 等模型實際上已將 95% 至 98% 的測試事實編碼於參數中,事實準確度的主要瓶頸在於「提取(recall)」而非「編碼(encoding)」。
研究團隊提出「事實級分析(fact-level profiling)」評估框架,取代單一提示詞的對錯評分,將模型知識分為五種狀態:直接提取、編碼失敗、提取失敗、思考後提取(透過 Chain-of-Thought 等推論期運算建立橋樑),以及無編碼推論。
報告指出,編碼失敗需透過擴展模型規模或訓練資料等預訓練介入來解決;而提取失敗則可透過後訓練介入改善。工程團隊無需依賴更大的模型或外部資料庫,即可藉由推論期運算解鎖模型既有知識,進而建立更可靠的應用程式。
讀原始報導背景
大型語言模型(LLM)的參數記憶體(parametric memory)是指將知識直接編碼至模型的權重中,這類事實的提取通常不需要複雜的算術或邏輯推演。此外,近期的推論期(inference-time)技術發展顯示,透過在推論過程中探索中間步驟,能在不需額外訓練的情況下進一步提升模型的推理能力。