模型發布
NVIDIA 推出開源 3D CT 視覺語言模型 NV-Reason-CT,結合 Qwen3.5-4B 與 3D ViT 支援思維鏈推理
NVIDIA Developer一手來源
已查原文 · 3 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證 NVIDIA 官方部落格文章,報導中的各項技術細節與官方聲明均獲支持。NV-Reason-CT 模型確實採用 Qwen3.5-4B 與 3D ViT 結合,處理 192³ 體素並產生 13,824 個 vision token,且透過 3D MRoPE 技術在 LLM 中維持空間關係。此外,該模型具備思維鏈功能,可辨識 30 種胸部與 29 種腹部異常並進行多輪對話。官方亦確實強調其為開源研發工具,而非已獲批的獨立臨床診斷產品。
NVIDIA 推出開源 NV-Reason-CT,結合 Qwen3.5-4B 與 3D ViT,並非獲批臨床產品。
原文提及模型結合 Qwen3.5-4B LLM,且官方明確聲明這是一項開放研發基礎,並非已獲准的臨床產品。
Qwen3.5-4B LLM
查看原始出處
cleared clinical product
查看原始出處

NVIDIA 推出專為 3D CT 分析設計的開源視覺語言模型 NV-Reason-CT。該模型架構結合 Qwen3.5-4B LLM 與 3D ViT(Primus/Colipri),其 3D 視覺編碼器將 CT 影像重採樣為 192³ 體素(2 mm 等向解析度),並切分為 8x8x8 的 patch token,產生共 13,824 個視覺 token。
為保留 3D 解剖結構的連續性,所有視覺 token 及其 3D 網格座標皆直接傳遞給 LLM,並透過 3D MRoPE 處理空間關係。在功能上,NV-Reason-CT 具備思維鏈(chain-of-thought)推理能力,能模仿放射科醫師的思考過程,支援針對胸部與腹部發現進行多輪對話,並可生成涵蓋 30 種胸部與 29 種腹部異常的結構化診斷報告。
官方強調,NV-Reason-CT 為開源研發基礎模型,需由開發者針對特定用途進行後訓練(post-train),並非獨立的自動診斷系統或已獲批的臨床產品。
讀原始報導背景
視覺語言模型(VLM)是一種能同時處理與生成影像及文字資訊的人工智慧系統,為大型語言模型(LLM)的延伸應用。NVIDIA 先前曾推出具備 30 億參數的 NV-Reason-CXR-3B 模型,專門用於胸部 X 光分析並產生逐步的診斷推論,而此次發表的新模型則是將此技術進一步擴展至 3D 醫療影像領域。