跳到主要內容
2026-10-01 日報
模型發布

GLM-5.3-Flash 混合 KDA 與 DSA 注意力機制,大模型架構轉向 Linear 搭配 Sparse

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,大模型注意力機制(Attention)正從單一技術路線走向混合重組。GLM-5.3-Flash 專案設定檔顯示,其 45 層架構中,有 34 層採用 Kimi 路線的 KDA 線性注意力(Linear Attention),另外 11 層採用 DeepSeek 路線的 KPool-DSA 稀疏注意力(Sparse Attention)。這種將 Linear 負責低成本維持長歷史、Sparse 負責精確檢索的組合,正逐漸取代過去由全局注意力(Full Attention)負責兜底的混合架構。 多家模型已展現此架構變遷趨勢。2 月發布的 MiniCPM-SALA 將 Lightning Attention 與 Sparse Attention 結合;8 月發布的 Qwen3.8-Flash-Next 延續三層 Gated DeltaNet 配一層 Attention 的結構,但將原本負責精確讀取的全局 Attention 改為 Qwen Sparse Attention (QSA)。 MiniMax 的架構演進亦反映了在能力與成本間的取捨。團隊經約 3700 次預訓練實驗後,於 2025 年 1 月發布 4560 億參數、支援 400 萬 token 的 MiniMax-01,採用 7 層 Lightning Attention 加 1 層 Full Attention 的架構。隨後,M2 模型因擔憂多跳推理等未知能力損失風險,重新全面採用 Full Attention。然而,針對 Agent 長期任務不斷增長的工作歷史,2026 年 6 月發布的 M3 轉向自研的 MiniMax Sparse Attention (MSA),官方數據顯示在 100 萬 token 上下文下,單 token 計算量降至前代模型的 1/20。 此技術流動亦得益於開源社群。由楊松琳維護的線性注意力開源社群 FLA 推動了演算法與介面的基礎設施化,Kimi 推進 KDA 時亦曾從該社群吸收核心貢獻者,促使不同機制的組合跨越單一公司的技術路線限制。
讀原始報導
本期分類