SciForma強化科學圖表結構
研究團隊提出 SciForma 科學方法圖表生成框架,將結構品質拆分為元件、箭頭與文字三個面向,並建立 SciFormaData-700K 訓練資料集及 SciFormaBench-2K 評測基準。其 M-DPO 方法可在後訓練階段同時要求各面向正確,並將梯度導向表現最不足的維度,也支援推論時反覆編輯修正。
HF Daily Papers
17 則值得知道的變化
研究團隊提出 SciForma 科學方法圖表生成框架,將結構品質拆分為元件、箭頭與文字三個面向,並建立 SciFormaData-700K 訓練資料集及 SciFormaBench-2K 評測基準。其 M-DPO 方法可在後訓練階段同時要求各面向正確,並將梯度導向表現最不足的維度,也支援推論時反覆編輯修正。
ReViV 提出首個整合式第一人稱 4D 重建框架,可從單目 RGB 影片同步重建相機軌跡、視線、全身與手部動作及深度。其 Masked Generative Egocentric Transformer 採單一前饋架構,在多項基準的準確度與效率達到最佳或具競爭力表現,且不依賴繁重的任務特定先驗。程式碼與模型已完整開源。
研究團隊提出 ShotPlan,透過可學習的規劃 token 與 FRoPE,讓文字轉影片模型能逐幀控制多鏡頭轉場時間。這套方法可整合至預訓練 DiT,無須注意力遮罩或修改架構,並支援硬切、柔和轉場及局部運鏡。實驗顯示其鏡頭管理與跨鏡頭一致性優於既有方法,模型與訓練資料亦已提供。