研究提出 DISCO 分散式長上下文架構,分離提取與推理任務,百萬 token 準確率達 78.4% 並降本 80%
該架構借鑒 Apache Spark,由 Worker 模型平行處理局部上下文,再由 GRPO 訓練的 Driver 模型統整證據,在 LongBench v2 評測提升 9.8 分。
HF Daily Papers一手來源
34 則值得知道的變化
該架構借鑒 Apache Spark,由 Worker 模型平行處理局部上下文,再由 GRPO 訓練的 Driver 模型統整證據,在 LongBench v2 評測提升 9.8 分。
系統透過自動分析執行軌跡,找出合併動作與壓縮上下文等四項機制,在 EdgeBench 測試中保留 93.7% 效能,每小時最高可省 13.5 美元。
該方案無需微調,透過預填提示詞與 vLLM 讀取特定 token 機率,使語言模型達到與 Jev 相當的決策速度與準確度,並額外支援圖像輸入。