MPIE-Bench:測試解剖學合理的多人互動編輯基準
為何重要
本研究揭示了當前 AI 影像生成與評估生態的關鍵缺陷:VLM-based 評估在 MPE(多人互動)場景下會出現嚴重的飽和與誤判,導致當代模型呈現出高錯誤率的潛在危機。它推動了評估標準的演進,未來模型能力的開發與驗證必須引入更嚴格的幾何與解剖學約束,以解決肢體融合、穿透等結構性難題,這將是從單人物場景跨越至多人物劇情編輯的技術門檻。
現有 Text-to-Image 雖能輕鬆合成高解析度單人影像,但在多人共處於擁抱或肢解等需共接觸的動作時,常出現肢體融合、多餘肢體或穿透等嚴重解剖學錯誤。本文提出 MPIE-Bench,由影片資料挖掘出的 2,500 個編輯三元組構成,涵蓋 405 場景、14 種互動類別與 4 等級接觸密度。
- 新方法 MPIE-Eval 採用凍結的公共多人網格重建模型,評估「解剖學」(質量解釋完整性)與「互動性」(物體穿透與表面距離)兩個維度。
- 在 10 位編輯器的測試中,網格解剖學最高僅 0.65 分、互動性最高 0.72 分,相比之下 VLM 檢查清單卻給予上述影像超過 0.95 的高分,證明現有評估方式存在盲點。