基於情境學習的 VLM Agent 機器人框架
為何重要
這項研究證明瞭通用大型語言模型的 Agent 能力可以跨越數位與物理世界的界線,將情境學習引入機器人領域。對開發者而言,這意味著將大幅縮短機器人的適應週期,避免依賴龐大的強化學習資料集;對產業而言,這強化了開發具身 AI 的技術路徑,將「感知-推論-執行」的閉環更加緊密。
讓機器人像人類一樣迅速適應陌生環境是具身 AI 的一大挑戰,現有策略受限於有限示範。本文提出 GPT-Policy 框架,利用商業 VLMs(如 GPT-6 Astra)讓機器人在無需引數更新的情況下進行「情境學習」。
- GPT-Policy 整合了上下文編譯器、視覺語言模型與受限控制器,用於從視覺轉換中擷取任務資訊並執行動作。
- 該框架能透過外部示範將通用智慧轉化為可驗證與物理執行的行為。
- 在真機實驗中,僅有人類影片示範即可提升任務成功率,對觸控敏感受任務配合經對齊動作參考時成效更佳。