FilmBench:面向電影級動態視訊生成的基準測試
為何重要
FilmBench 強制將視訊生成的評估焦點從單純的畫質逼真度轉向真實電影敘事所需的深層語言與敘事邏輯。該基準揭示了當前主流模型在長序列一致性與實拍級光影流暢度上的顯著差距,這是未來從實驗室演示走向消費性 AI 動畫或電影商業化的關鍵門檻。
針對現有視訊生成評測多使用網路來源或通用指標、無法反映專業電影語言的問題,研究團隊推出 FilmBench,結合北京電影學院專業導師與湖鏡數位媒體,打造貼近真實電影製作的評估標準。
- 供應鏈與內容來源:由北京電影學院與湖鏡數位媒體與娛樂集團共同開發,採用獲獎電影片段反推提示詞。
- 資料規模與結構:包含 1,169 個提示詞,其中 1,056 個為多鏡頭要求,評量維度採三軸十二元件、共 35 個 T2V 指標與 3 個 R2V 指標。
- 開源工具與驗證:團隊開源了核心運算套件 FilmOps,並在 9 個 T2V 與 7 個 R2V 模型上驗證,評估結果與人類判斷高度一致(模型層級 Spearman 相關係數為 0.95 - T2V 與 0.96 - R2V)。
- 轉型與差距:影片品質明顯低於過往基準,兩個顯著落點在於動態美學與單鏡到多鏡的連續性。