模型發布
inclusionAI 發布 9B 視聽互動模型 Realtime-Venus,支援全雙工對話與主動互動
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群消息,inclusionAI 在 Hugging Face 發布了 Realtime-Venus 系統的兩個模型權重,包含 9B 參數的視聽互動模型 Realtime-Venus-Omni 與專注於音訊的 Realtime-Venus-Audio。Realtime-Venus-Omni 基於 MiniCPM-o 4.5 改編,支援原生全雙工對話,能在生成語音時持續感知輸入,並區分使用者的中斷、糾正或重定向。模型具備主動互動能力,可持續處理時間對齊的視聽資料,並在特定事件發生時主動回應,無需等待使用者提示;同時支援免訓練的長影片記憶,可封存視覺資訊並檢索重組視聽上下文。此外,系統支援非同步工具委派(Delegation),外部任務不會阻塞對話進行;輸出方面則透過綁定的 Token2wav 資源與參考語音,同步生成文字與原生語音。
讀原始報導