跳到主要內容
2026-10-02 日報
研究與評測

開發者在 FRAMES 資料集評測 18 種 RAG 架構,Agent loop 準確率達 92.7% 擊敗傳統 RAG

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群開發者分享,其在 Google 的 FRAMES 資料集(包含 824 個多跳問題)上,控制相同模型與文檔條件,評測了 18 種傳統 RAG pipeline 與 Agent loop 的表現。結果顯示,最佳的傳統 RAG 架構準確率為 78.9%,而具備檢索工具、可讀取結果並重複搜尋的 Agent loop 準確率高達 92.7%,幾乎等同直接提供正確文章的表現。測試亦發現,加入小型重排序(reranker)模型反使最佳架構的準確率下降 9 個百分點,大型重排序模型也幾乎無助益。此外,模型常無視「僅依賴檢索文檔」的指令,用自身記憶填補答案並生成虛假引用;團隊為此逐一核對正確答案是否真來自讀取到的文本。評測採用端到端答案準確率,由 Claude Sonnet 5 與 Gemini Flash 3.8 擔任裁判,兩者一致性極高(Cohen's κ 0.93–0.98),相關程式碼已於 PipesHub 專案開源。
讀原始報導
本期分類