ShieldVLA:具可行性知覺的安全性對齊視覺語言動作模型
為何重要
過去機器人自動化部署受限於實體損壞風險與龐大的安全標註成本,ShieldVLA 透過數學保證與自動化的語義監督,大幅降低了 VLA 在特定範疇技術應用的門檻。若此技術路線後續被主流平臺整合,將直接影響機器人即服務商業化的安全風險控制流程,加速具備實體操作能力的 AI Agent 市場成熟。
Vision-Language-Action (VLA) 模型雖在機器人與導航表現上強大,但現有微調方法缺乏安全保證且難以從視覺資料學習安全性。ShieldVLA 提出基於 Hamilton-Jacobi (HJ) 可達性的無模型框架,並透過 rubrics-based VLM 安全分數解決標註缺失問題。在五個導航與操作基準測試中,該框架平均將累積安全性成本降低 57%,且任務成功率比基準 SafeVLA 提升 0.13。
- 系統核心基於 Hamilton-Jacobi (HJ) 可達性價值函式,透過學習模型自由近似值來估計安全操作區域,並將獎勵最大化與不安全狀態恢復分離。
- 引入 rubrics-based VLM 安全分數,將視覺語言模型的語義安全性反饋轉換為結構化的批評目標,無需手動標註即可進行監督。
- 在多個 VLA 架構的導航與操作基準上,平均累積安全性成本降低 57%。
- 任務成功率比現有觸發器 SafeVLA 提升了 +0.13。