ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SeededGrasp:多具身體型場景中的語言引導抓取

工具 1 個來源 · 14 天前
為何重要

本研究解決了「具身 AI」中資料效率與部署困難的痛點,透過解耦語義與幾何,證明瞭在不使用需龐大算力的模型時仍可達到高精度的抓取能力。對於產業開發者,這是一個可借鑑的架構範式;對於投資人,則觀察到 RaaS(機器人即服務)在成本結構最佳化上的技術突破。

背景脈絡

複雜場景中的機器人抓取任務,傳統方法需高昂的端到端訓練成本與大量資料。現有方式多依賴 VLM 直接預測抓取,導致空間感知有限且難以跨載體擴充套件。

具體事實與結果

  • 提出 SeededGrasp 架構,將 VLM 的高階推理與輕量型抓取模型的低階幾何執行解耦,需進行種子點預測。
  • 釋出首個多具身桌面抓取資料集,收錄逾 250 萬個雜亂場景中的抓取動作。
  • 實驗 surpass 現有基準,模擬環境成功率為 72%,真實世界實驗中達 78%。
SeededGraspVLM具身 AIGraspingUoT ISLMulti-embodiment

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00