SeededGrasp:多具身體型場景中的語言引導抓取
為何重要
本研究解決了「具身 AI」中資料效率與部署困難的痛點,透過解耦語義與幾何,證明瞭在不使用需龐大算力的模型時仍可達到高精度的抓取能力。對於產業開發者,這是一個可借鑑的架構範式;對於投資人,則觀察到 RaaS(機器人即服務)在成本結構最佳化上的技術突破。
背景脈絡
複雜場景中的機器人抓取任務,傳統方法需高昂的端到端訓練成本與大量資料。現有方式多依賴 VLM 直接預測抓取,導致空間感知有限且難以跨載體擴充套件。
具體事實與結果
- 提出 SeededGrasp 架構,將 VLM 的高階推理與輕量型抓取模型的低階幾何執行解耦,需進行種子點預測。
- 釋出首個多具身桌面抓取資料集,收錄逾 250 萬個雜亂場景中的抓取動作。
- 實驗 surpass 現有基準,模擬環境成功率為 72%,真實世界實驗中達 78%。