模型發布
騰訊與清華等發布 Spatial-TTT-2B 模型:採混合架構與動態快權重,VSI-Bench 空間基準測試超越 GPT-5
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,清華大學、騰訊混元與南洋理工大學研究團隊聯合發布 Spatial-TTT-2B 模型,透過測試時訓練(TTT)架構解決連續影片流的空間記憶與算力瓶頸。
模型採用 3:1 的混合架構,將解碼器中 75% 的注意力層替換為 TTT 層,以動態更新「快權重」壓縮時序資訊,並保留 25% 全注意力層負責跨模態對齊與邏輯推理。為兼顧硬體平行效率與時空連續性,TTT 層採用 2648 個 Token 的大區塊(Chunk)更新策略,並結合雙路平行結構:主幹路負責跨區塊長程記憶,旁路採用滑動窗口注意力(SWA)彌補區塊內的局部因果連續性。此外,模型引入 3D 深度可分離卷積,將視覺特徵重組為時空體素網格,為快權重注入三維連續幾何偏置;並採用帶動量與正交約束的 Muon 最佳化器防止權重爆炸。
訓練階段使用基於 3D 場景圖構建的密集場景描述資料集(涵蓋 ScanNet 與 ARKitScenes 約 1.6 萬個室內漫遊樣本),並採用兩階段漸進式訓練:先透過滑動窗口退火策略引導快權重學習長程記憶,再接入約 300 萬條空間問答資料提升推理能力。
在 VSI-Bench 空間基準測試中,Spatial-TTT-2B 取得 64.4 分,超越 GPT-5(55.0 分)與 Gemini-3-pro(56.0 分);其中相對朝向任務達 73.0%,物體計數達 70.8%。在測試跨視角一致性與遮擋推理的 MindCube-Tiny 基準中,該模型綜合準確率達 76.2%,領先 Gemini-3-pro(63.9%)與開源模型 MindCube-3B(51.7%)。
讀原始報導