將視覺語言模型之轄管能力轉移至機器人控制
為何重要
這項研究具體驗證了強大語言模型的邏輯推理能力可應用於物理世界,為具身智慧帶來新的技術路徑——即透過「理解」而非純粹的試錯來解決機器人難題。 對於開發者而言,這意味著未來義肢、監控機器人或自駕系統可能無需昂貴的追蹤資料,只需透過小範例就能快速適配新場景。 從產業觀點看,此「推理即策略」的架構可能大幅降低具身 AI(Embodied AI)的開發門檻與訓練成本,是推動通用操作機器人落地的重要一步。
研究團隊發布 RoboDawn 介面,旨在將大型視覺語言模型(VLM)的推理能力直接轉化為機器人控制指令,解決數位世界與物理世界的適配問題。
- RoboDawn 採用封閉迴路設計,讓 VLM 透過觀察視覺狀態、推導邏輯與執行後續動作(含平移、旋轉、夾取等離散指令)來進行自主控制。
- 引言入 in-context learning (ICL) 機制,透過少量範例設定不僅能最佳化介面操作,亦能建立解題策略。
- 在 RoboTwin 2.0 C2R 基準上,加入單一範例的一最佳化(one-shot)成功率顯著提升至 73.6%,超越基線 π0.5 的 46.0%。
- 所提框架已驗證部署於真實機器人,在 Franka 機器人上成功執行堆疊方塊等物理動作。