ReferTrack:具身視覺追蹤的「指名後追蹤」範式
為何重要
本篇研究直指具身智慧領域中 VLA 模型監督與可解釋性的痛點,提供一種將自然語言指令直接落地為影像空間偵測的新穎解決方案。這項技術強化了單視角攝影機在動態環境下的長期追蹤能力,有助於降低具身機器人對多相機裝置的依賴,加速服務型機器人商用部署的程序。其優異的模擬到真實輸送能力,證實了具身視覺系統在複雜現實場景實作上的可行性,對開發者實現 Robust Policy 至關重要。
為解決現有視覺語言動作(VLA)政策在監督抽象潛在空間上的困難,本研究提出 ReferTrack 模型,採用單一前相機與「先指名後追蹤」架構,讓機器人透過自然語言關鍵字從候選邊界框中精準選取並持續追蹤目標。該模型利用 TVBI tokens 將歷史幾何特徵注入視覺歷史,並在自訂 Refer-QA 資料集上強化目標識別。在 EVT-Bench 基準測試中,ReferTrack 創下單檢視表現 SOTA(單目標 89.4%、分心 73.3%、模糊 74.1%),且在識別密集任務中表現甚至優於部分多相機基準。