跳到主要內容
2026-09-24 日報
模型發布

NVIDIA 推出開源 3D CT 視覺語言模型 NV-Reason-CT,結合 Qwen3.5-4B 與 3D ViT 支援思維鏈推理

NVIDIA Developer一手來源
已查原文 · 3 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經查證 NVIDIA 官方部落格文章,報導中的各項技術細節與官方聲明均獲支持。NV-Reason-CT 模型確實採用 Qwen3.5-4B 與 3D ViT 結合,處理 192³ 體素並產生 13,824 個 vision token,且透過 3D MRoPE 技術在 LLM 中維持空間關係。此外,該模型具備思維鏈功能,可辨識 30 種胸部與 29 種腹部異常並進行多輪對話。官方亦確實強調其為開源研發工具,而非已獲批的獨立臨床診斷產品。

NVIDIA 推出開源 NV-Reason-CT,結合 Qwen3.5-4B 與 3D ViT,並非獲批臨床產品。

原文提及模型結合 Qwen3.5-4B LLM,且官方明確聲明這是一項開放研發基礎,並非已獲准的臨床產品。

Qwen3.5-4B LLM

查看原始出處

cleared clinical product

查看原始出處

3D 視覺編碼器將 CT 重採樣為 192³ 體素,切分產生 13,824 個 token 並交給 LLM 的 3D MRoPE 處理空間關係。

原文記載模型將輸入重採樣為 192³ 體素,產生 13,824 個視覺 token,並藉由 3D MRoPE 來處理 3D 空間關係。

192³ voxels

查看原始出處

13,824 vision token

查看原始出處

3D MRoPE

查看原始出處

模型具備思維鏈推理能力,支援多輪對話,可生成涵蓋 30 種胸部與 29 種腹部異常的結構化報告。

原文指出模型支援 chain-of-thought 推理與多步對話,且能產生涵蓋 30 種胸部與 29 種腹部異常的報告。

chain-of-thought

查看原始出處

30 chest and 29 abdominal

查看原始出處
NVIDIA 推出專為 3D CT 分析設計的開源視覺語言模型 NV-Reason-CT。該模型架構結合 Qwen3.5-4B LLM 與 3D ViT(Primus/Colipri),其 3D 視覺編碼器將 CT 影像重採樣為 192³ 體素(2 mm 等向解析度),並切分為 8x8x8 的 patch token,產生共 13,824 個視覺 token。 為保留 3D 解剖結構的連續性,所有視覺 token 及其 3D 網格座標皆直接傳遞給 LLM,並透過 3D MRoPE 處理空間關係。在功能上,NV-Reason-CT 具備思維鏈(chain-of-thought)推理能力,能模仿放射科醫師的思考過程,支援針對胸部與腹部發現進行多輪對話,並可生成涵蓋 30 種胸部與 29 種腹部異常的結構化診斷報告。 官方強調,NV-Reason-CT 為開源研發基礎模型,需由開發者針對特定用途進行後訓練(post-train),並非獨立的自動診斷系統或已獲批的臨床產品。
讀原始報導

背景

視覺語言模型(VLM)是一種能同時處理與生成影像及文字資訊的人工智慧系統,為大型語言模型(LLM)的延伸應用。NVIDIA 先前曾推出具備 30 億參數的 NV-Reason-CXR-3B 模型,專門用於胸部 X 光分析並產生逐步的診斷推論,而此次發表的新模型則是將此技術進一步擴展至 3D 醫療影像領域。

來源