為何 video diffusion 模型違反物理定律?揭露注意力機制的缺陷
為何重要
這項研究直指 Video Diffusion 模型物理邏輯敏感度的根本機制,為開發者提供了「Training-free」的架構最佳化技術線索。雖然研究屬於學術探討,但其發現指出 Attention Mechanism 配置的細節會直接影響物理規律的合理性,是提升視訊生成品質的關鍵技術突破口。對產業而言,若能驗證並整合此類架構修正方案,將有助於解決常見的物體穿模或違背重力規律的問題。
目前最先進的 video diffusion 模型雖視覺品質優異,卻常生成違反物理法則的內容;本研究首度透過可解釋性角度追蹤模型早期去噪階段的「motion planning」過程,指出了 Rotary Position Embedding (RoPE) 是造成注意力衰減的關鍵源頭。
- 首次在 text-to-video 模型中進行可解釋性研究,標記出驅動 motion planning 的特定 attention heads。
- 分析發現 Rotary Position Embedding (RoPE) 在早期去噪時導致過度的空間注意力衰減,強迫候選區域鎖定在物理上不可行的位置。
- 提出輕量級架構修訂策略,調整不同去噪步驟下的 RoPE 頻率以減少衰減,增強生成的物理常識連貫性。