ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

基於情境學習的 VLM Agent 機器人框架

工具 1 個來源 · 6 天前
為何重要

這項研究證明瞭通用大型語言模型的 Agent 能力可以跨越數位與物理世界的界線,將情境學習引入機器人領域。對開發者而言,這意味著將大幅縮短機器人的適應週期,避免依賴龐大的強化學習資料集;對產業而言,這強化了開發具身 AI 的技術路徑,將「感知-推論-執行」的閉環更加緊密。

讓機器人像人類一樣迅速適應陌生環境是具身 AI 的一大挑戰,現有策略受限於有限示範。本文提出 GPT-Policy 框架,利用商業 VLMs(如 GPT-6 Astra)讓機器人在無需引數更新的情況下進行「情境學習」。

  • GPT-Policy 整合了上下文編譯器、視覺語言模型與受限控制器,用於從視覺轉換中擷取任務資訊並執行動作。
  • 該框架能透過外部示範將通用智慧轉化為可驗證與物理執行的行為。
  • 在真機實驗中,僅有人類影片示範即可提升任務成功率,對觸控敏感受任務配合經對齊動作參考時成效更佳。
GPT-PolicyRobot LearningVLM AgentEmbodied AIIn-Context Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00