跳到主要內容
2026-09-30 日報
研究與評測

研究人員發表 CoWA 與 MALA 注意力機制,128K 上下文運算子前向速度最高提升 7.4 倍

Reddit r/MachineLearning單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 上的論文作者發文指出,研究團隊近期發表兩篇探討長上下文模型注意力機制冗餘運算的新論文,提出 CoWindow Attention (CoWA) 與 MassAlloc Attention (MALA) 兩種架構。 CoWA 透過互補視窗將遠距離上下文分配給不同的 KV head,並共用局部與前綴(prefix-sink)視窗;每個 head 雖為稀疏注意力,但聯集可覆蓋完整因果歷史,且無需學習路由器或索引器。MALA 則保留完整的因果 QK 評分,利用注意力本身的 softmax 統計數據決定是否執行後續的 tile 運算,藉此減少低貢獻的評分後工作。 在 8 張 H100 GPU(TP=8)處理 128K tokens 的實測中,相較於 FullAttn,CoWA 的注意力運算子前向速度提升 7.4 倍、後向 8.6 倍、解碼 3.0 倍;MALA 則分別提升 2.2 倍、3.0 倍與 1.6 倍(此為運算子加速,非端到端模型加速)。 團隊評估了 0.6B 至 14B 的擴展,並在 32B 進行持續訓練實驗。在 14B 模型與 32K 上下文條件下,CoWA 與 MALA 的總訓練 FLOPs 分別減少 28.5% 與 23.1%,且模型能力與 FullAttn 相當。作者也表明其限制:CoWA 的集體覆蓋不代表與 FullAttn 有相同的 head-wise 互動或輸出;MALA 仍需付出完整因果 QK 評分的運算成本,兩者皆未證實可完全無損等效於密集注意力(dense attention)。
讀原始報導
本期分類
相關主題