GST-Bench:視覺語言模型能否透過影片建立全域空間感知?
為何重要
此基準揭露了當前 VLM 在整合長時間地圖建立與一致性安全檢查上的說謊與盲點,顯示模型雖具備區域性洞察,卻缺乏創造穩定全週期世界模型的關鍵能力。對於開發者而言,要讓機器具備具身智慧或導航能力,光有多模態訓練還不夠,必須專注於訓練資料中強化「全域場景整合」的紀錄。
現有評估多著重於單一或有限視角的區域性感知,忽略了長時間影片上下文中的全域空間推理需求。研究團隊推出 GST-Bench 基準測試,透過來自 6,790 分鐘合成影片的經人工核驗提問,測試模型從未見視角進行空間推論並對映至俯檢視的能力;結果顯示 22 個最強 VLM 的零樣本僅得 42.68 分,遠低於人類的 79.08 分。