研究與評測
浙大與斯旺西大學提出 VLM 微調新架構 A3B2,以動態剎車機制解決圖像塔泛化衰退問題
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,浙江大學與斯旺西大學聯合團隊針對視覺語言大模型(VLM)微調提出 A3B2(Adaptive Asymmetric Adapter)自適應非對稱適配器,相關論文已被 IJCAI 2026 接收。
研究團隊指出,傳統微調 CLIP 等雙塔模型時,在未知場景(OOD)下激進微調圖像塔會嚴重破壞預訓練的通用視覺表達。A3B2 為此採用「單一下採樣降維矩陣 + 多個上採樣專家 + 動態路由器」的非對稱結構。
該架構以分類機率最高值作為置信度,當遇到低置信度的未知資料時,會觸發 L_bias 剎車機制,將圖像塔的總修正向量壓向 0,使模型退回 CLIP 原始圖像特徵;文本塔則不設剎車機制,持續微調以快速對齊新類別概念。
實驗顯示,在 11 個主流視覺資料集上,A3B2 於基類到新類泛化、跨資料集評估及域泛化三大任務中,全面領先 CoOp、MaPLe、MMRL 等 11 種基準方法。該方法相容 Vision Transformer(ViT)與 ResNet-50 架構,且在單張 A800 GPU 上即可完成低開銷訓練與推論。
讀原始報導本期分類