AVE-Compass:邁向全像式的音訊視訊編輯能力評估
為何重要
AVE-Compass 的推出填補了音訊視覺編輯領域缺乏高品質綜合評量的空白,將 SOTA 模型的表現水準拉回現實壓力測試中。AVE-Agent 展示了 agent 框架利用自我反思解決多模態內容一致性問題的潛力,這不僅是研究上的突破,也為未來開發具備跨媒體編輯能力的高階 AI 工具提供了實作參考與新方向。
真實世界的影片中音訊與視覺訊號緊密耦合,但現有評估標準多聚焦於單一媒體編輯,導致跨模態一致性能力長期遭低估。研究人員發布全新的標準評估方法,並提出一個 agent 框架來改善編輯品質。
- AVE-Compass 標準共收錄 145 條選定影片、196 條音訊視覺共耦編輯指令,並細分出 2,688 個檢查點。
- 評估採用 checklist-based MLLM 判斷搭配專屬 realism rubric,並結合跨模態、影片與音訊的自動化指標。
- AVE-Agent 模組化框架透過分解複雜指令、自我反思與回饋來提升指令執行能力,同時在保持品質下解決現有模型的跨模態不協調問題。