模型發布
開發者開源物理決策模型 Vega:提供 800M 與 4B 規格,支援 73k 上下文及影像輸入
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
獨立開發者 Nandakishor_ml 於 Reddit r/LocalLLaMA 宣布開源新型物理型型態化決策模型 Vega。該模型提供 800M(8 億參數)與 4B 兩種規模,具備 73k token 上下文長度並支援影像輸入。架構上採用引擎結合轉接器的測試時訓練(Test-Time Training, TTT)設計,作者宣稱其在單次(single-shot)測試表現超越先前的 Jev 評測基準。
根據作者描述的決策機制,模型接收輸入的觀察內容、問題與預期選項(例如 YES 或 NO)後,從隱藏層提取各項目及最後 token 的特徵向量,並透過權重矩陣進行投影。觀察向量會投影形成具備「山谷」的地勢地貌(山谷數量依選項數量決定),問題與尾端 token 則初始化地勢中的球體位置;決策過程模擬球體在重力與摩擦力影響下滑動,最終落入代表特定選項的山谷即為輸出結果。專案已公開 GitHub 程式碼、HuggingFace 模型權重與展示空間。
讀原始報導背景
Jev 是由 TypeSafe AI 開發的專有判別式(discriminative)AI 模型,主要用於分類或回歸等任務,並不生成自然語言文字。而 Test-Time Training(TTT)則是一種在測試階段將未標記樣本轉為自監督學習問題以更新模型參數的架構技術,旨在改善模型在不同資料分佈與長文本環境下的表現。