BVB:透過 Blender 程式化重建評估代理影片理解
為何重要
此研究將影片理解評測從單純的問答擴充套件至程式化重建,標誌著對多模態代理能力評估更嚴格的標準。結果顯示潛空間的視覺相似度並不等同於對內容的精確掌握,尤其『記憶正確性』不足(53.7%)與『視覺相似』之間的落差,將制約影片編輯、資訊檢索等需嚴格邏輯一致性場景的應用落地。
為了評估多模態代理對影片的真實理解能力,研究團隊推出 BVB(Blender-VideoBench),要求代理在 Blender 中透過編碼重建真實影片,而非僅依賴生成式模型。
- 代理在統一的沙盒環境中透過輕量型 harness(Mini-BVB)進行影片重建,且所有配置均受制於相同的成本限制。
- 評估標準包含(1)Dual VQA,佔比衡量重建影片保留原始空間與時間事實的程度;(2)Latent Similarity,衡量視覺感知上的還原相似度。
- 研究測試了 10 個模型系列共 51 種配置,結果顯示最佳模型的 Latent Similarity 為 88.6,但僅保留 53.7% 的事實正確答案。