ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

MPIE-Bench:測試解剖學合理的多人互動編輯基準

研究 1 個來源 · 6 天前
為何重要

本研究揭示了當前 AI 影像生成與評估生態的關鍵缺陷:VLM-based 評估在 MPE(多人互動)場景下會出現嚴重的飽和與誤判,導致當代模型呈現出高錯誤率的潛在危機。它推動了評估標準的演進,未來模型能力的開發與驗證必須引入更嚴格的幾何與解剖學約束,以解決肢體融合、穿透等結構性難題,這將是從單人物場景跨越至多人物劇情編輯的技術門檻。

現有 Text-to-Image 雖能輕鬆合成高解析度單人影像,但在多人共處於擁抱或肢解等需共接觸的動作時,常出現肢體融合、多餘肢體或穿透等嚴重解剖學錯誤。本文提出 MPIE-Bench,由影片資料挖掘出的 2,500 個編輯三元組構成,涵蓋 405 場景、14 種互動類別與 4 等級接觸密度。

  • 新方法 MPIE-Eval 採用凍結的公共多人網格重建模型,評估「解剖學」(質量解釋完整性)與「互動性」(物體穿透與表面距離)兩個維度。
  • 在 10 位編輯器的測試中,網格解剖學最高僅 0.65 分、互動性最高 0.72 分,相比之下 VLM 檢查清單卻給予上述影像超過 0.95 的高分,證明現有評估方式存在盲點。
MPIE-BenchAnatomically PlausibleMulti-Person InteractionVLMBenchmarkMesh Reconstruction

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00