ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

DistillAlign:協調自回歸影片製作中的模式覆蓋與模式尋找

研究 1 個來源 · 7 天前
為何重要

這項研究挑戰了「大模型擁有壓倒性優勢」的既有觀點,證明透過演算法上的分佈對齊協議,小規模基礎模型完全可以在影片製作任務中超越大規模教師模型。這對於企業在降低推理成本與解決視覺生成不穩定(多樣性低)問題上,提供了具體的技術路徑方向。

現行自回歸影片製作方法常因忽略潛在空間中的分佈對齊,導致小規模學習器難以繼承大規模教師模型的能力。本研究引入潛在空間評估協議,證明透過協調模式覆蓋與模式尋找,能顯著改善影片生成的多樣性。

  • 發現現行視覺評分(如 VBench)無法診斷出學習器與教師之間的「精密度」與「覆蓋率」分佈差異。
  • 指出 DMD 的逆 KL 目標會在訓練後期驅動模型偏向高機率區域,導致多樣性降低。
  • 提出 DistillAlign 聯合製作方法,結合分佈匹配的找模式目標與一致性製作(CD)的覆蓋約束。
  • 實驗顯示,即使以 Wan-1.3B 作為 DMD 教師,其輸出表現仍優於經 Wan-14B 微調的基準線。
DistillAlign影片製作自回歸分佈對齊Wan

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00