驅動零:超越人類示範的端到端駕駛系統
為何重要
過去模仿學習限制了自駕系統的行為範圍,本研究突顯了「具體感知基礎模型 + 閉環強化學習」聯合架構的潛力。這不僅驗證了在不仰賴過往人類示範下走出新路徑的可能性,也為開發者提供了減輕冷啟動與標註痛點的技術解決方案。
現有端到端自駕系統受制於人類示範的軌跡品質,DriveZero 提出一個端到端系統,將駕駛行為拆解為感知模型與動作模型,模擬表現超越人類軌跡重放的專家水準。
- 動作端引進
DriveRL閉環強化學習框架,使用 PPO 訓練特權指導者策略。 - 感知端
DriveVFM整合 DINOv3、SigLIP2、SAM 和 Depth Anything V2 等凍結的視覺基礎模型。 - 在
nuPlan順應與反應模式下的 Val14、Test14-hard 和 Test14-random 指標,平均分達 93.57。 - 在
NAVSIMv1、NAVSIMv2和HUGSIM上達到 SOTA 並完全不用人類軌跡標註。