Qwen新TTS雙版本登場
Qwen 發布 Qwen-Audio-3.0-TTS,分為主打即時互動的 Flash 與高品質生成的 Plus 版本。新模型支援 16 種語言,可透過行內標籤與自然語言控制耳語、憤怒、呼吸及笑聲等表現,並能從含雜訊的參考音訊產生乾淨輸出。
24 則值得知道的變化
Qwen 發布 Qwen-Audio-3.0-TTS,分為主打即時互動的 Flash 與高品質生成的 Plus 版本。新模型支援 16 種語言,可透過行內標籤與自然語言控制耳語、憤怒、呼吸及笑聲等表現,並能從含雜訊的參考音訊產生乾淨輸出。
Thinking Machines 發布 Inkling,這款 975B 參數、41B active 的 MoE 開放權重模型,可接收文字、影像與音訊並輸出文字。模型支援 BF16 與 NVFP4,並可透過 Transformers、vLLM、SGLang 等框架在本地部署。
Google DeepMind 的開放權重指令模型 google/gemma-4-31B-it 登上 Hugging Face 熱門榜。模型支援文字與圖像輸入、最高 256K context,並具備推理、程式開發及原生函式呼叫能力。
NVIDIA 在 Hugging Face 發布 4B 參數的 Cosmos3-Edge,並登上熱門模型榜。該模型採用 Mixture-of-Transformers(MoT)架構,可處理文字、圖像、影片與動作軌跡等多模態輸入,支援世界模擬、未來預測、動作推理及 Physical AI 應用。
阿里於 7 月 21 日發布第三代圖像生成與編輯基礎模型 Qwen-Image-3.0,最高支援 4.5K Token 文字輸入,長度為前代的 4.5 倍。新模型強化複雜指令、空間版面與多層資訊理解,並支援 12 種語言及 20 多種字型的原生算繪。