跳到主要內容
2026-09-03 日報
模型發布

智源研究院開源 Recon2Reason-Reasoning-4B 視覺語言模型,專注室內場景空間推理

HF @BAAI一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

智源研究院(BAAI)在 Hugging Face 上架全新的多模態推理模型 Recon2Reason-Reasoning-4B。該模型為 44 億參數(4,437,815,808)的視覺語言模型,基於 Qwen3-VL-4B-Instruct 微調而成,專門針對室內與具身(embodied)場景的空間推理進行最佳化。 該模型能改善從視覺輸入中對度量距離、相對位置、物體配置與空間關係的推理能力,並支援單張與多張影像輸入。架構上保留標準的 Qwen3VLForConditionalGeneration,無需依賴自訂模型程式碼(trust_remote_code=True)。 模型權重採用 BF16 精度與 Safetensors 格式發布,採 Apache-2.0 授權,目前已支援透過 Transformers、vLLM、SGLang 及 Docker Model Runner 進行部署。官方註明,本次僅發布推理模型,檢索增強的場景重建擴充模組將另行發布。
讀原始報導

背景

北京智源人工智能研究院(BAAI)是中國的非營利人工智慧研究機構。其推出的 Recon2Reason-Reasoning-4B 是一個 4B 參數規模的視覺語言模型,專門針對室內與具身場景的空間推理進行最佳化。

來源