LAION 釋出千萬小時開源多模態影片資料集 LAION-BVD
團隊從 CommonCrawl 下載 8000 萬支影片,透過場景偵測萃取片段並生成影音字幕,支援影片、聲音與圖片的跨模態預訓練。
64 則值得知道的變化
團隊從 CommonCrawl 下載 8000 萬支影片,透過場景偵測萃取片段並生成影音字幕,支援影片、聲音與圖片的跨模態預訓練。
透過工作記憶追蹤進度並引導技能選擇,將 Claude Opus 5 成功率推升至 87.9%,最長任務表現提升達 32.2 分。
透過固定元操作遞迴處理輸入以建立更深的推理層次,在八大基準測試中全面超越先前的自我改進代理,程式碼已開源。
該 MoE 模型運行於 11 套 GB200 NVL72 系統,預計耗時三個月,並即時公開所有實驗配置、中途修改與失敗紀錄。
模型以 10.9 萬小時無標註資料預訓練,在糖尿病風險等七項臨床預測任務中表現優異,並於餐後血糖預測取得最低平均絕對誤差。
該框架基於 Wan2.1 模型,透過三階段蒸餾將推理步數降至 4 次,並結合遮罩快取機制減少未編輯區域計算,已被 ECCV 2026 接收。
據報導,三星在會中展示了實際運作的晶片、效能數據與設計,推動記憶體內運算邁向實際部署,為 AI 硬體架構帶來新突破。
結合有界價值預測與蒙地卡羅目標解決 Critic 訓練不穩問題,在 1.5B 至 30B MoE 模型的數學推理任務中均獲驗證。
該框架解決終端獎勵無法修正中途錯誤的問題,讓模型交替扮演代理與評論家進行線上與離線最佳化,並在 6 項領域外測試保持領先。
團隊澄清額度重置為單純補償機制,並透露 Ultra Fast 模式理論提速達 14 倍,但受網路開銷限制,實際體感僅 3 至 4 倍。
採選擇性啟用,將小型模型下載至本機偵測非聯絡人異常訊息,並透過透明度帳本與差分隱私技術,在不讀取對話內容下回傳效能指標。
報告深入探討測試框架(harnesses)的設計與評估方法,並涵蓋深度 n+ RLM 與驗證器支援等技術細節。
該框架透過統一路由器控制快取復用、視覺 token 剪枝與層跳過,將 FLOPs 降至 29.4%,並在 SIMPLER 基準測試中超越 CogACT 稠密基線。