Qwen Audio 3.0評測登頂
Alibaba 推出原生語音到語音模型 Qwen Audio 3.0 Realtime,提供 Plus 與 Flash 版本。Plus 在 Artificial Analysis Speech to Speech Index 以 84.1% 居首,並領先三項組成評測,Flash 則以 76.3% 排名第四。
X @ArtificialAnlys
23 則值得知道的變化
Alibaba 推出原生語音到語音模型 Qwen Audio 3.0 Realtime,提供 Plus 與 Flash 版本。Plus 在 Artificial Analysis Speech to Speech Index 以 84.1% 居首,並領先三項組成評測,Flash 則以 76.3% 排名第四。
OpenAI 在 API 推出 GPT-Live-Transcribe 與 GPT-Transcribe,前者主打低延遲即時轉錄,後者用於已完成音檔的非同步轉錄與批次工作。官方表示,兩款模型能更理解上下文,提升跨語言、口音及高噪音環境下的轉錄準確度。
據單一來源文章整理,昨日發布的開放權重模型 Kimi K3 據稱規模達 2.8T,並具備原生多模態能力。其架構延續 Kimi Linear,導入 LatentMoE、全面採用 NoPE,並以注意力殘差改善跨層連結。報告稱注意力殘差可小幅提升驗證損失與下游效能,但會增加約 4% 訓練成本與 2% 推論成本;官方細節尚待進一步佐證。