跳到主要內容
2026-08-06 日報
開發生態

Qwen3-TTS 語音複製功能合併至 llama.cpp 主線,支援 1.7B Base 模型與 10 種語言

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,Qwen3-TTS 語音複製功能的新實作已正式合併至 llama.cpp 的 master 分支。 該實作目前支援 GGUF 格式的 Qwen3-TTS-12Hz-1.7B-Base 模型,可透過約三秒的 WAV 或 MP3 參考音檔進行語音複製,並支援中、英、日、韓、德、法等 10 種語言,音訊生成須透過 llama-tts 執行檔進行。 目前該功能仍有部分限制:僅支援 1.7B Base 模型(不含 CustomVoice 或 VoiceDesign),/tts 伺服器端點仍處於 PR 草案階段,且此次更新包含對現有 llama-tts 執行檔的破壞性變更。 社群指出,將語音複製整合進主線,可大幅降低在現有 llama.cpp 專案中加入本地語音輸出的門檻。目前尚未有針對語音相似度、穩定性,或與 PyTorch 原版及專用移植版(如 qwen3-tts.cpp)的獨立效能評測數據。
讀原始報導

背景

`llama.cpp` 是一個用於大型語言模型推論的開源 C/C++ 軟體函式庫,被廣泛視為本機端推論工具的業界標準。而 Qwen3-TTS 是由 Qwen 開發的開源語音生成模型系列,其採用自主研發的 Qwen3-TTS-Tokenizer-12Hz 來實現高效的聲學壓縮。

來源