ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

N_0-VTLA:具潛在觸覺 Token 的視覺-觸覺-語言-動作模型

研究 1 個來源 · 3 天前
為何重要

對於機器人自動化產業而言,該模型證實了「觸覺整合」能突破單純視覺系統在物理操作上的盲區,解決如滑動物體處理等長期痛點。透過離線策略改進與大規模資料預訓練,降低了機器人習得複雜操控技能的資料門檻,可能成為具通用操作能力的機器人從實驗室邁向商業化部署的一座技術踏腳石。

研究團隊發表了具備視覺-觸覺-語言-動作整合能力的 N_0-VTLA 基礎模型,旨在解決機器人需面對接觸豐富物體時,如何利用觸覺回饋與語言指令進行精細操控的問題。此模型透過 NeoData 資料集進行大規模觸覺預訓練,並結合名為 ALTER 的離線強化學習方法,利用既有部署資料提昇觸覺導向的技能表現。

  • 觸覺資料大規模整合:這是首個在 NeoData 大規模視覺觸覺機器人資料集上進行預訓練的 VTLA 模型,透過預測觸覺通路將潛在觸覺 Token 轉化為精緻的動作調整。
  • 引入 ALTER 方法:提出優勢條件離線強化學習方法 ALTER,將過往部署資料轉化為二元優勢標籤,有效改進可變形物體操控等需要複雜接觸感知的技能。
  • 顯著的效能優勢:在 20 任務模擬套件中達到 63.8% 的平均成功率,遠勝於基準模型的 44.0%;在 NEOReal 9 個真實機器人任務測試中全數獲勝,使用 ALTER 訓練的政策在長時間軸真實任務上成功率高達 75-95%。
N_0-VTLAVTLANeoDataALTERRoboticsManipulation

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00