跳到主要內容
2026-08-27 日報
研究與評測

LAION 釋出千萬小時開源多模態影片資料集 LAION-BVD

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

LAION 釋出大規模開源多模態影片資料集 LAION-BVD,總時長達 1000 萬小時。 團隊從 CommonCrawl 收集了 13 億個特定平台的影片網址,並實際下載其中 8000 萬支影片,專為影片、聲音與圖片的跨模態預訓練設計。在資料處理上,團隊採用內容感知場景偵測技術萃取影片片段,並合成影片與聲音字幕;同時透過萃取場景變換的影格作為圖文資料的替代來源,提供與標準網路圖片語料庫不同的視覺分佈。 基於該資料集訓練的模型在標準影片-文字與聲音-文字評測基準上表現具競爭力,且效能隨訓練或模型規模擴大而穩定提升。目前相關資料集網址與 ViCLIP 等模型已在 Hugging Face 開放。
讀原始報導

背景

LAION 是一個德國非營利組織,致力於提供開源的人工智慧模型與資料集,過去曾釋出用於訓練 Stable Diffusion 等知名文字生成圖片模型的大型網路爬蟲資料集。而 Common Crawl 則是定期抓取網路資料並免費公開的非營利組織,其網頁存檔是近年許多 AI 訓練的重要來源。

來源

本期分類