模型發布
InternLM 發布模組化記憶體解碼器 Intern-MemDec-4B,搭配 397B 主幹模型使生物任務均分提升 3.4 分
HF @internlm一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
InternLM 於 Hugging Face 上架記憶體解碼器模型 Intern-MemDec-4B,這是一個專為擴展 Intern-S2 主幹模型領域知識而設計的輔助組件,並非獨立語言模型。
推論時,Intern-MemDec-4B 與 Intern-S2 主幹模型會平行處理相同的上下文,並透過輕量級的 token 級別路由器動態決定雙方對下一個 token 預測的貢獻比例。該機制將領域檢索資料壓縮成可重複使用的參數模組,推論時無需存取原始資料庫。此版本專注於生物學領域(涵蓋 DNA、RNA、蛋白質及生物分子交互作用),能在不更新主幹模型參數的情況下注入專業知識,避免干擾原有的通用推理、多模態與代理能力。
官方測試顯示,將 Intern-MemDec-4B 搭配具備 3970 億參數的 Intern-S2-Preview-397B 主幹模型部署,在 Biology-Instructions 的 21 項任務中,平均分數由 56.92 提升至 60.32(+3.40 分),同時維持了跨領域的通用效能。
讀原始報導背景
MemSFT 是一種旨在減輕「對齊稅」(alignment tax)的技術,透過隨插即用的外部參數化記憶體來擴充已凍結的語言模型。該方法將領域專業化與主幹模型的參數更新脫鉤,讓模型能在不更動原有權重的情況下學習特定領域知識。