跳到主要內容
2026-08-27 日報
模型發布

清華與港科大開源即時流式影片編輯框架 LiveEdit,4 步推理達 12.66 FPS

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,清華大學與香港科技大學研究團隊提出並開源即時流式影片編輯框架 LiveEdit,該研究已被 ECCV 2026 接收。LiveEdit 建立在 Wan2.1-T2V-1.3B 基礎上,使用 Ditto-1M 資料集中的兩萬組資料進行訓練。 為解決流式編輯的延遲與計算負擔,該框架採用三階段蒸餾:先透過 Foundation Tuning 建立雙向編輯先驗,接著以 Teacher Forcing 對齊分塊因果注意力,最後使用分布匹配蒸餾(DMD)將推理步數從 100 次壓縮至 4 次,並移除 Classifier-Free Guidance。此外,LiveEdit 引入面向自回歸的遮罩快取(AR-oriented Mask Cache),動態預測編輯區域,讓未編輯 Token 優先重複使用 Self-Attention 層的快取特徵,裁剪約 70% 的冗餘空間 Token。 實測顯示,在 4 步/影片塊的推理條件下,LiveEdit 處理 81 幀影片的總延遲為 7.89 秒,達到 12.66 FPS。研究團隊指出,該方法目前依賴相鄰影片塊編輯區域穩定的假設,面對目標快速移動或大範圍全域修改時,遮罩估計與快取策略仍有最佳化空間。
讀原始報導

背景

LiveEdit 所使用的基礎模型 Wan2.1-T2V-1.3B 屬於 Wan 影片生成框架,該框架支援單一與多主體的參考影片生成。此外,其訓練所依賴的 Ditto-1M 是一個包含一百萬筆高保真影片編輯範例的資料集,最初耗費超過一萬兩千個 GPU 運算天數(GPU-days)建構而成。

來源