TurboVLA:在消費級 GPU 上實現低 VRAM 的即時視覺語言動作模型
為何重要
本研究證實瞭解耦視覺與語言路徑是提升具身智慧體效率的可行途徑,將推論門檻從高昂的大型語言模型切換為輕量級互動架構。對開發者而言,這代表未來更易在消費級硬體上部署具自然語言導航能力的機器人;對產業而言,若能將此低成本、高效率架構複製並商業化,將極大降低具身 AI 系統的軟硬體整合成本,加速通用機器人的落地。
傳統 VLA(視覺-語言-動作)模型常依賴大型語言模型 (LLM) 作為感知與動作之間的中介,導致推論成本高昂。TurboVLA 透過引入直接 V + L 對映機制,在保留效能的同時顯著降低計算與記憶體負荷。
- 模型引數量僅 0.2B(2 億),採用輕量雙向視覺語言互動與緊湊解碼器設計。
- 在 LIBERO 基準測試上達到 97.7% 平均成功率和 31.2 ms 推論延遲,可在 RTX 4090 上實現 32 Hz 即時運作。
- 在消費級 RTX 4090 上的推論僅需 0.9 GB VRAM,大幅低於傳統 LLM-centric 方案的記憶體需求。