跳到主要內容
2026-07-19 日報
模型發布

ShotPlan精準控制影片轉場

HF Daily Papers
研究團隊提出 ShotPlan,透過可學習的規劃 token 與 FRoPE,讓文字轉影片模型能逐幀控制多鏡頭轉場時間。這套方法可整合至預訓練 DiT,無須注意力遮罩或修改架構,並支援硬切、柔和轉場及局部運鏡。實驗顯示其鏡頭管理與跨鏡頭一致性優於既有方法,模型與訓練資料亦已提供。
讀原始報導

背景

現有影片生成模型雖能產生單一鏡頭,但在需要連貫敘事與多鏡頭編排的電影級影片上,仍需要明確的鏡頭規劃。ShotPlan 將鏡頭規劃表示為一系列可學習的規劃 token,直接注入影片擴散生成流程,讓模型在單一連貫過程中掌握各鏡頭的起訖位置與轉場方式,而不必另設鏡頭偵測或剪輯階段。

來源