模型發布
據報 audio.cpp 0.5 加入 DramaBox 可控情緒 TTS、Confucius4-TTS 跨語言聲音轉換
Reddit r/LocalLLaMA未證實
Reddit r/LocalLLaMA 貼文稱,audio.cpp 0.5 已發布,新增 DramaBox、Confucius4-TTS、RVC、BS-RoFormer、GLM-TTS、Kroko ASR、Parakeet-TDT、Inflect Micro v2 與 Fun-ASR-Nano 等模型或功能;官方目前尚未證實這項發布。DramaBox 是以 LTX-2.3 3.3B audio-only 模型為基礎的 IC-LoRA 微調版本,能透過提示詞控制情緒、語氣、笑聲、嘆氣、停頓、轉場與說話者行為,並可選用 10 秒聲音參考複製目標音色。Confucius4-TTS 支援 14 種語言的無口音語音合成,可提供參考聲音,在不需額外訓練的零樣本模式下合成另一種支援語言的語音。貼文另稱,Fun-ASR-Nano 來自官方 FunASR 團隊,audio.cpp 已列入 FunASR 官方部署平台。平台更新還包括 AMD GPU 的早期 HIP/ROCm 支援、Apple Silicon 上更快的 Metal,以及伺服器與串流路徑新增即時 PCM 輸入和更乾淨的串流轉錄增量結果。
讀原始報導背景
DramaBox 是以提示詞控制說話者身分、情緒、語氣、笑聲、嘆氣、停頓與轉場的 TTS 模型,也可用選擇性的 10 秒聲音參考來複製目標音色。它是 LTX-2.3 3.3B audio-only 模型的 IC-LoRA 微調版本;Confucius4-TTS 則支援 14 種語言的跨語言語音合成與零樣本聲音轉移。