Qwen Audio 3.0評測登頂
Alibaba 推出原生語音到語音模型 Qwen Audio 3.0 Realtime,提供 Plus 與 Flash 版本。Plus 在 Artificial Analysis Speech to Speech Index 以 84.1% 居首,並領先三項組成評測,Flash 則以 76.3% 排名第四。
23 則值得知道的變化
Alibaba 推出原生語音到語音模型 Qwen Audio 3.0 Realtime,提供 Plus 與 Flash 版本。Plus 在 Artificial Analysis Speech to Speech Index 以 84.1% 居首,並領先三項組成評測,Flash 則以 76.3% 排名第四。
月之暗面於北京時間 7 月 27 日晚開放 Kimi K3 的模型權重、技術報告與關鍵 Infra 技術;模型總參數達 2.8T,每次生成約啟用 104B 參數。公開驗證的最低部署配置為 8 張 AMD MI355X,但僅代表能載入模型,生產級服務仍需更高算力與部署能力。
Arena.ai 公布 Muse Spark 1.1 最新成績:Document Arena 排名由前代第 21 升至第 11、得分 1472,Vision Arena 排名第 14,中文類別更達第 3。
OpenAI 在 API 推出 GPT-Live-Transcribe 與 GPT-Transcribe,前者主打低延遲即時轉錄,後者用於已完成音檔的非同步轉錄與批次工作。官方表示,兩款模型能更理解上下文,提升跨語言、口音及高噪音環境下的轉錄準確度。
Google 一次推出 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash Cyber,主打低成本、高吞吐與 agentic 工作流程效率。
據單一來源文章整理,昨日發布的開放權重模型 Kimi K3 據稱規模達 2.8T,並具備原生多模態能力。其架構延續 Kimi Linear,導入 LatentMoE、全面採用 NoPE,並以注意力殘差改善跨層連結。報告稱注意力殘差可小幅提升驗證損失與下游效能,但會增加約 4% 訓練成本與 2% 推論成本;官方細節尚待進一步佐證。
據36Kr報導,Mind Lab發布並開源Macaron-V1,以Mixture-of-LoRA協作與持續學習強化GLM-5.2及Qwen3.6基座模型。正式版分為748B參數的Venti與50B參數的Tall,皆原生支援200萬token上下文。