研究與評測
LVSum長影片摘要評測基準
Apple ML
Apple ML 發布 LVSum,這是一套具細緻時間對齊標註的長影片摘要評測基準,收錄橫跨 13 個領域的 72 支影片,平均長度為 16 分鐘,每支影片最多有 10 份含時間參照的人類摘要。評測涵蓋內容相關性、模態一致性與標準自動化指標,結果顯示逐字稿對摘要品質的貢獻遠高於單獨使用視覺影格。研究也指出,現有 MLLMs 與人類摘要仍有明顯差距,並在時間定位、指令遵循及跨模態一致性方面存在系統性弱點。
讀原始報導背景
長影片摘要對多模態大型語言模型(MLLMs)仍具挑戰,模型不易在長時間跨度下維持時間準確性,並產生兼具語意與時間依據的摘要。LVSum 是具細緻時間對齊的人工作業標註基準,收錄橫跨 13 個領域的 72 支影片,平均長度 16 分鐘,每支影片最多附有 10 份含時間參照的人工摘要,並用於評估開放原始碼及專有 MLLMs。