模型發布
火山引擎發布語音內容編輯模型,支援以自然語言指令局部改詞並保留原音色
AI 前線單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,火山引擎多媒體實驗室發布全新語音內容編輯模型,支援使用者透過自然語言指令(如「把 A 改成 B」)直接修改已錄製的語音內容。有別於傳統重新錄製或複雜的音訊剪輯,該模型能定位問題片段並進行局部再生成,在替換詞彙的同時,延續原說話人的音色、韻律與上下文語境。技術架構上,模型先透過音訊 Tokenizer 將聲音轉換為離散的音訊 Token 序列,並與自然語言指令一同輸入生成框架。生成過程採用 CoT 式語義規劃,先形成修改後的語義表達再生成音訊 Token,並在解碼階段引入原音訊的聲學與說話人特徵,最後由聲碼器還原為波形。模型透過成對編輯數據進行監督微調,目前已開放測試,未來計畫擴展至中、英文等多語言場景,並針對口播糾錯與廣告改詞等應用持續最佳化。
讀原始報導相關主題