跳到主要內容
2026-09-09 日報
模型發布

Qwen 發布自動駕駛視覺語言模型 Qwen-Drive-1.0-4B,整合 3D 感知與運動規劃

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群發現,Qwen 團隊在 Hugging Face 發布了針對自動駕駛微調的視覺語言模型 Qwen-Drive-1.0-4B,並附帶 40 頁的技術報告。該模型保留了預訓練 VLM 的架構,將 3D 感知、視覺問答(VQA)與運動規劃整合於統一框架中。系統包含一個外部鳥瞰圖(BEV)感知頭,負責聯合執行 3D 物件偵測、語義佔用預測與 BEV 地圖分割;另設有規劃專家(Planning Expert)模組,可基於共享的 VLM 表示生成未來的自車軌跡。訓練方面採用分階段策略,結合駕駛監督與通用視覺語言資料,在獲取駕駛能力的同時保留通用的視覺理解與指令遵循能力。報告指出,該模型在開環、偽閉環與閉環設定下均展現具競爭力的運動規劃效能。完整的 Bf16 權重檔案大小約為 9GB。
讀原始報導