PlannerForge:用於自動駕駛運動規劃器的 LLM 智慧體框架
為何重要
此框架展示了 LLM 在整合自動駕駛複雜測試管道中的潛力,將傳統分散的任務轉化為統一的智慧體協作。關鍵是,它能以低成本提升關鍵的運動規劃效能且無需訓練,加速開發週期。此趨勢顯示開源模型(如 Qwen)在關鍵安全系統測試中已具備與閉源大模型抗衡的能力,商業化與基礎建設策略需從「API 依賴」轉向「開源生態整合」。
為確保自動駕駛安全,基於場景的測試至關重要,但現有流程往往支離破碎。研究團隊推出 PlannerForge,一套統一的 LLM 智慧體框架,將場景測試流程從生成延伸至評估,並新增 ADS 增強與基準測試階段。
- 在 5 種提示條件下測試 10 款 LLM,涉及場景生成、選擇、修改等任務,最佳分數為 0.88 至 1.00。
- 開源 20-35B 模型(如 Qwen3.6:35B)在多數任務中表現等同商用 API,甚至有 3 項任務匹配商用 API。
- 在 N=400 評估中,透過 cost-tuning 提升規劃器成功率從 50.4% 至 70.2%,碰撞次數從 19.0% 降至 8.4%,免領域微調。
- 場景生成效能優於 Scenario Factory 2.0(生產 193 個可執行片段對比 144 個),符合屬性需求達 92-96%。