Show-Harness:只靠 VLM 代理就能玩轉機器人,破解具身控制的介面之謎
為何重要
這項突破挑戰了「先進模型先贏」的慣例,證明在優良的介面設計與輕量微調下,小規模模型亦可具備強泛化力,甚至動用 Claude 等封閉源巨頭的視覺能力。對開發者與工業界而言,這大幅降低了具身智慧的資料與算力門檻,避免了昂貴的具身預訓練需求,有助於推動 AI 機器人更快速的實作與部署。
基礎視覺語言模型雖具廣泛的世界智識,但轉化為機器人控制仍面臨技術壁壘。研究團隊提出 Show-Harness,透過緊湊的語義介面連線意圖與行動,讓 VLM 能自然地「玩」操控機器人。
- 定義 Show-Harness 為具身 Harness,成功解鎖封閉源前沿 VLM 的零樣本(zero-shot)機器人控制能力。
- 新開發的 GUMI 介面將語義訓練資料流程擴及 GUI 操作,允許人類和代理透過 GUI 操作跨具身行為的示範。
- 實驗證明僅需幾小時的 GPU 微調,低成本的開源 VLM 便能有效地部署並優於 agentic 和 VLA 範式。