研究與評測
研究提出 DISCO 分散式長上下文架構,分離提取與推理任務,百萬 token 準確率達 78.4% 並降本 80%
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
研究團隊提出 DISCO(DIStributed long COntext scaling)架構,旨在解決大型語言模型處理長文本時,因龐大搜尋負擔耗盡表示能力而導致推理品質崩潰的「上下文腐敗」(context rot)現象。
該架構借鑒 Apache Spark 等分散式運算框架,採用「提取與推理分離」機制。系統將長上下文分割給多個 Worker LLM 進行平行的局部資訊提取(grounding);中央的 Driver LLM 則透過 GRPO 強化學習最佳化規劃能力,負責將查詢動態拆解為原子任務,並彙整 Worker 收集的證據以合成最終答案。
透過隔離推理與原始上下文雜訊,DISCO 在 RULER-QA(100 萬 token)測試中維持 78.4% 的準確率,避免了標準模型的效能崩潰。此外,該架構在 LongBench v2 領先全上下文模型達 9.8 分,並在匹配 Gemini-3-Pro-Preview 等前沿模型表現的同時,降低超過 80% 的推論成本。
讀原始報導背景
大型語言模型在處理極長文本時,常面臨推論品質隨輸入長度增加而下降的現象。為最佳化模型的規劃能力,研究採用了 GRPO 演算法,這是一種省略價值函數(value function)的 PPO 變體,透過對提示詞進行多次採樣來建立計算基準。此外,評估長文本能力的 RULER-QA 則是專為百萬 token 上下文窗口設計的問答資料集。