模型發布
據報騰訊推出 Gander 模型:採「大腦-小腦」架構,支援即時語音中斷並可抽換背景任務模型
The Decoder單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,騰訊混元語音團隊與多所大學研究人員共同推出 Gander 模型,旨在讓 AI 在背景處理複雜任務時仍能保持即時對話。技術報告指出,Gander 可同時處理語音、影像與文字,並採用仿生雙架構:由「小腦」負責管理每秒的即時對話與中斷,而「大腦」則在背景處理推理與複雜的代理(agent)任務。
該架構允許在不重新訓練對話模型的情況下抽換「大腦」,例如換成 Codex 或 Claude Code。報導提及,在測試中曾使用 OpenAI「GPT-5.6 系列」的未具名模型作為大腦。Gander 將對話切分為一秒的片段,並使用過去約兩分鐘的對話作為記憶,無需獨立模組即可判斷何時該聆聽、發言或因使用者打斷而停止。
在 Full-Duplex-Bench v3 測試中,Gander 展現了最佳的對話時機掌握,在 100 個場景中皆於正確時機發言,且僅在 8% 的情況下誤中斷使用者(優於 GPT-Realtime 的 13.5% 與最弱競品的近 48%)。然而,Gander 在任務準確率上略為落後,且在影片與音訊理解(如計算或定位影像中的物體)表現不如其基礎模型,研究團隊將此歸因於訓練過程偏好流暢對話而犧牲了精確感知。
Gander 使用約 270 萬筆範例進行訓練,包含教導模型在背景噪音或未被點名時保持安靜。團隊目前已建立 GitHub 儲存庫並展示 Demo,預計在完成開源流程後發布模型權重與訓練資料。
讀原始報導