透過 RoboFollow 揭示具身智慧體中指令跟隨的迷思
為何重要
RoboFollow 挑戰了目前具身智慧體的評估標準,顯示許多高分模型可能只是掩飾了真實語言理解與情境推理的不足;開發者需採用更高層級的診斷協議,將語言與視覺的整合性作為關鍵瓶頸來解決。
現代具身智慧體雖看似成功,但實際指令跟隨能力往往被「高分假象」掩蓋;研究指出這是因為場景低熵導致語言多餘。
- 提出 RoboFollow 診斷基準,要求高場景熵(單一場景須支援多個運動學獨特任務分支)。
- 採用四層診斷協議(L0-L3)遞增難度,測試視覺佈局與語義變化對行為一致的影響。
- 測試九種 VLA 和 WAM 政策,發現強大的 L0 表現無法可靠轉移至 L1-L3。
- 多種修正手法如強化 VLM backbone、QA co-training、LangForce 等均未能縮小評測場景間的差距。