跳到主要內容
2026-08-07 日報
研究與評測

華為與螞蟻集團 IJCAI 2026 論文揭曉:華為發表 30B 參數層級化 ViT,螞蟻聚焦動態環境適應

AI 科技評論綜合 2 家報導單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

IJCAI-ECAI 2026 將於 2026 年 8 月 15 日至 21 日在德國不來梅舉行。據報導,華為與螞蟻集團各有四篇論文入選,分別展現對算力最佳化與動態環境適應的技術路徑。 華為的四篇論文聚焦於透過架構設計降低算力與資料成本: 第一,在視覺基礎模型方面,華為發表《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,將層級化 ViT 的參數上限從 2B 提升至 30B。該模型採用 Efficient Hierarchical ViT 架構與稀疏專家混合(SMoE)變體,並透過兩階段訓練(ImageNet-21K 自監督預訓練與 2700 萬圖像資料集蒸餾)。總參數達 30B 的 EHV-5B-MoE 模型在推論時僅啟動 67 億參數,於 ImageNet-1K 線性評測準確率達 89.0%,超越 180 億參數的 EVA-CLIP-18B。 第二,針對 Video-LLM 的運算成本,華為提出可學習的影格選擇器 LFS(Learnable Frame Selector)以取代均勻採樣。LFS 透過評分網路分段挑選關鍵影格,並將其輸入凍結的 Video-LLM 生成描述來計算損失與更新參數。團隊同時建立基於中國非遺烹飪真實場景的新評測基準 ICH-CC。 第三,在大型語言模型跨任務泛化方面,華為雲端團隊提出 RaMod(Representation-Aware Modularity)框架。該框架透過挑選中間層隱藏表徵的子集進行模組化干預,並配備非同步排程器主動管理記憶體。實驗顯示,相較於原始 LLM,RaMod 減少 83% 額外預填時間、降低 100% 生成延遲,並減少 79% 顯示記憶體占用。 第四,針對語碼轉換(Code-Switching)語音翻譯資料稀缺問題,華為翻譯服務中心提出 MoE 語音投影器與多階段漸進式訓練策略(從 ASR 資料過渡到單語語音翻譯,再適配到 CS 語音翻譯)。該方法在 Fisher 與 NTUML2021 測試集上的 BLEU 最高達 39.52、COMET 達 81.33,超越 SeamlessM4T。 另一方面,螞蟻集團入選的四篇論文則聚焦於 AI 模型在真實世界動態環境中的自適應能力。其中包含 MSRGC-Net,該研究旨在讓時間序列分群能自適應資料密度分布,以應對支付流量波動與風控策略迭代等高頻率的動態變化。
讀原始報導

背景

ViT 於 2021 年被提出用於大規模影像辨識,但擅長多尺度表徵的層級化 ViT 卻長期面臨參數規模難以突破的瓶頸。隨著 AI 算力成本攀升,目前的技術趨勢已從單純擴張模型規模,轉向透過架構設計與訓練策略來提升運算效率。

來源

本期分類