透過潛在空間進行推論!強制「CVRR」迫使模型依賴隱含推理路徑
為何重要
過去許多模型被認為具備「潛在推理」能力,但本研究證實這不代表模型實際利用了潛在空間進行計算,揭示了模型可能存在「作弊」行為。CVRR 技術為多模態模型提供了一種強制的驗證機制,確保推理過程確實發生在隱藏狀態中,對於追求高可信度與可解釋性的多模態 Agent 系統架構設計具有重要啟發。
現有多模態模型的「潛在視覺推理」可能並未強烈依賴隱藏狀態,若仍保留替代的圖片條件路徑,模型容易直接透過視覺路徑輸出答案。研究提出 Causal Visual Recurrent Reasoning (CVRR) 架構,透過強制定義遞迴運算為必經的圖片條件路徑,迫使模型在預訓練視覺語言模型整合圖片後,且解碼前移除視覺狀態與原始多模態 KV 快取的前提下,僅靠最終遞迴狀態產生答案。在 $V^*, MMVP, BLINK, MME-RealWorld-Lite$ 等基準測試中,CVRR 保留了強勁表現力,而相容的潛在推理模型則無法在相同限制下恢復可比較的視覺能力。