跳到主要內容
2026-07-18 日報
模型發布

InternLM開源403B多模態模型

橘鸦AI早报據報導
據報導,InternLM 發布並開放 Intern-S2-Preview-397B 權重;模型實際參數量為 403B,支援最長 256K 文字與 64K 多模態推理長度。模型採用直接從科學文獻原始頁面進行視覺預訓練的新方法,並支援工具呼叫、時間序列推理與長程 Agent。官方宣稱其通用推理效能在開放模型中領先,但目前未提供其他佐證來源。
讀原始報導

背景

Transformer 是以多頭注意力機制為基礎的神經網路架構,會將文字轉為 tokens 與向量,並在上下文視窗內建立彼此關聯。FlashAttention-4 針對 Blackwell GPU 的硬體瓶頸重新設計運算管線,運用非同步 MMA、較大區塊與 tensor memory 等技術,減少非矩陣運算及共享記憶體流量。

來源