Noiz AI 發布實時交互影音世界模型 HelixWorld 1.0,支援 24FPS 畫面與 48kHz 立體聲
模型採原生 Transformer 架構統一生成聲畫,結合軌跡蒸餾與 DMD 技術將去噪壓至個位數,預計數週內開源權重與程式碼。
量子位單一來源
57 則值得知道的變化
模型採原生 Transformer 架構統一生成聲畫,結合軌跡蒸餾與 DMD 技術將去噪壓至個位數,預計數週內開源權重與程式碼。
該模型目前處於測試階段,能將情緒與故事等生活語言轉化為包含詞曲及人聲的完整歌曲,並宣布與太合音樂集團達成戰略合作。
該模型基於自研 UiT 架構,支援文本與圖像等多模態輸入,透過 Memory 上下文與 TTT 機制解決時空一致性難題,論文已入選 ECCV 2026。
該模型將審核任務轉化為 Yes/No 判斷題,透過對比式訓練整合文本與視覺理解能力,在多項安全基準測試中擊敗體積達七倍的大型模型。
支援逾 40 種語言,定價每百萬字元 49 美元,雖高於 Simba 3.2 等同級競品,但價格僅 Eleven v3 的一半。
團隊累積逾 50 萬小時人類第一視角影片資料,新模型直接於 embedding space 預測動作,並與地瓜機器人展開端側部署合作。
REX G1 內建 2070 TFLOPS 端側算力,雙臂負載 10 公斤並支援熱插拔換電,可進入 0.75 米窄通道,作業高度達 2 公尺。
升級原生 10-bit 色深輸出並強化光影材質細節,圖生影片 API 首月限時降價至每秒 2.7 元人民幣,主打專業後期製作。
本輪由 Menlo Ventures 領投。新模型 Canto 將錯誤率降至 10% 以下;公司同步推出會議記錄工具,並與 Oasis 智慧戒指展開硬體合作。