CARDEA:基於空間證據的可稽核推理模型,用於冠狀動脈攝影全端判讀
為何重要
CARDEA 展示了在 CV-LLM 的醫療應用中,RLVR 與 CoB 訓練策略能有效解決「無法生成可解釋開放式報告」的瓶頸,將生成準確率從平庸顯著拉昇至可用水準。對產業而言,這提供了將高風險臨床判斷從「黑盒」轉向「白盒」的可實作架構,特別是邊界框視覺化對於獲得臨床醫師信任與監管批准至關重要。此外,透過 RLVR 將閉放式任務與可驗證的離線獎勵結合的技術路徑,也對未來 AI Agent 的訓練範式具有借鑑意義。
研究團隊發布名為 CARDEA 的統一大視覺語言模型(LLM),旨在解決現存冠狀動脈攝影(CAG)輔助判讀系統缺乏視覺化依據與可稽核推理過程的問題。該系統採用三階段訓練流程:視覺特徵對齊、自我離線 Chain-of-Box (CoB) 冷啟動,以及帶有可驗證獎勵的強化學習 (RLVR)。CARDEA 的輸入來自多視角原始影片,結合關鍵幀選擇進行層級分析,呈現可追溯的空間證據。
- 在領域變換後的冠狀動脈優勢分類中,CARDEA 的準確率為 0.91 (95% CI:0.86–0.95),與專用分類器持平。
- 在複雜度評估任務上,CARDEA 表現與兩位介入性心臟科醫師相當,準確率達 0.90 (95% CI:0.82–0.97)。
- 原本未調整的基礎模型 vessel-severity macro-F1 僅 0.513,經 RLVR 訓練後提升至 0.686 (95% CI:0.664–0.707),超越幾乎為零的 always-normal floor (0.312)。