應用於自動駕駛 VLA 的可驗證推理:DEFT-RLVR 與 AD-MCQ 框架
為何重要
該研究解構了高階自動駕駛中依賴 Ground Truth 的潛在缺陷,證明此慣用做法會導致因果推論失效及幻覺。透過 AD-MCQ 與 DEFT-RLVR 構建的可驗證推理架構,研究為 VLM 在 L3/L4 自動駕駛系統中的落實提供了一條可行的替代路徑,從源頭降低了系統的不確定性,提升了決策的可解釋性與安全性。
為了增強自動駕駛 Vision-Language-Action (VLA) 模型的推理能力,研究者廣泛使用 Chain-of-Thought (CoT) 驗證,但現有管道會暴露教師模型到 Ground Truth 未來路徑,導致模型錯誤理性化結果而非從場景證據推論,這引發了嚴重的幻覺問題。
- 路徑錨定偏見會產生因果關係較不忠實的 CoT,尤其在因果挑戰場景中會導致更嚴重的幻覺。
- 提出的 Autonomous-Driving Multiple-Choice Question (AD-MCQ) 框架將規劃轉換為在明確軌跡候選者之間的選擇,避免開放式幾何合成。
- DEFT-RLVR 將路徑從事前決策錨點轉變為事後決策驗證目標,僅使用 VLM 推理即可改善推理能力且不損害視覺能力。