簡報:NVIDIA 釋出 NV-Reason-CT 模型,開源 3D CT 視覺語言模型以支援醫師鏈式思考推理
為何重要
3D 體積成像長期被通用 VLM 忽略,NV-Reason-CT 透過完整的 3D 觀測與鏈式思考推理,填補了放射診斷從標籤輸出到邏輯審查的空白。這對醫療 AI 產業意味著「推理能力」正取代單純「分類能力」,成為提高臨床信賴度與加速工作流整合的關鍵分水嶺。該模型開源的性質也可能帶動臺灣半導體與醫療軟體團隊投入更深入的 3D 臨床應用研發。
NVIDIA 釋出專為 3D 電腦斷層(CT)設計的開源視覺語言模型 NV-Reason-CT,結合專用 3D Vision Transformer 與 Qwen3.5-4B,以解決通用模型在體積成像上的表現弱點。
- 在 CT-RATE 基準測試中,該模型達到 Macro-F1 0.614 和 Macro-AUROC 0.871,資料優於現有的 3D 對比及 2D/3D 融合基線。
- 模型將 CT 掃描重建為 13,824 個視覺 token(192³ 體素、2mm 解析度、8x8x8 patch),並整合 3D MRoPE 以保留透過切片的空間關係。
- 雖經 NIH 放射科醫師驗證臨床合理性,但該產品僅為開放研究基礎架構,非經核准的臨床產品。