GAVEL:利用圖世界模型驗證與修復長期機器人規劃的框架
為何重要
GAVEL 展示了結構化世界模型與大型語言模型 協同工作的最佳實踐,能有效解決 LLM 在具身智慧 領域的「黑盒」與不確定性問題。這項成果證明瞭利用顯式結構來約束 LLM 行為、防止違規,是提升機器人在複雜長期任務中成功率與執行效率的關鍵路徑。
大型語言模型 雖然適合長期執行規劃,但常因動作不符 身體力行限制、錯誤修正能力不足或部分可觀性問題而失敗。研究團隊提出 GAVEL 框架,透過顯式的「圖世界模型」來預測動作後果、驗證並修復 LLM 產出的計畫。
- 在 BEHAVIOR-1K 基準上測試,GAVEL 配合 Qwen3-8B 可將單一長期任務成功率從 41.2% 跳升至 91.8%,多工成功率則由 19.9% 提升至 92.6%。
- 採用分散式信念推理的版本,相比靜態變體約能減少 5.4% 的移動距離。
- 該框架將圖世界模型與 LLM 分離,讓 LLM 僅在需深度含義推理的錯誤發生時計畫重做。