機器人操作新架構:Agent 作為政策 (AGP)
為何重要
這項突破將大語言模型的推理能力延伸至物理世界控制,大幅降低開發人員構建自動化機器人介面的開發難度與成本。透過即時程式設計與環境互動,AGP 開啟了具備容錯性與適應性的自主機器人商用化潛力,改變了目前強化學習需要大量示範資料的密閉生態模式。
研究提出「Agent as Policy (AGP)」方法,讓通用 Agent 能直接驅動物理機器人執行任務,而在執行過程中無需特定任務或環境訓練。
- AGP 掌控任務規劃與執行,透過視覺證據解讀、編寫可執行程式及傳送運動指令,並根據物理結果修正動作。
- 測試涵蓋精準操作、動態動作與可變形物體,包含人類影片組裝、目標影像積木建構、骰子重新定位、目標投擲雙手毛巾摺疊等多種場景。
- AGP 在三種積木建構配置中成功率高達 100%、100% 和 80%。