RULER:具體細緻評分指導,用於 SVG 生成最佳化
為何重要
這項研究提供了緩解 RL(強化學習)中「獎勵駭客」問題的具體解決方案,證明瞭結構化的「多軸評分」比單一視覺相似度指標更能反映人類審美。這種改變評估邏輯的思路,為未來其他缺乏標準的開放式生成任務(如 3D 建模或程式碼生成)指明瞭改進方向。
為解決從自然語言指令生成 SVG 時缺乏絕對地標真值的難題,研究發現傳統標量指標(如 CLIP)在風格化向量圖上適用性差且會引發獎勵最佳化偏差。該論文提出一種基於多軸評分表 的方法,讓 VLM 作為評判機制來解決這兩個限制。