用於一致多參考影像編輯的評估驗證獎勵模型
為何重要
這項研究解決了視覺生成領域中「評估標準量化」的難題,證明瞭評判機制可與產生式模型解耦。對於開發者而言,這提供了一條在不重寫底層架構的情況下,利用強化學習大幅提升多參照編輯一致性品質的可行路徑。
隨著影像編輯技術進步,如何在多參照編輯中維持視覺一致性仍是關鍵挑戰。現有的強化學習方法受限於缺乏捕捉多影像關聯的獎勵模型,且直接使用大型多模態模型進行零樣本評估容易在長篇推理中產生幻覺。本研究推出的 multi-dimensional Evaluation-Verification Reward (EVR) 架構,透過將評估分解為不同視覺標準,並讓驗證器根據實體證據來判定陳述真偽,為現有編輯器提供了可行的訓練方案。