TempCloze:Video-LLMs 能否有效偵測影片的「缺失中段」?
為何重要
此研究精準定位了 Video-LLM 當前的技術瓶頸:模型往往具備單一畫面或事件的語義理解能力,卻難以將其精準對應到正確的時間序位。對開發者而言,這意味著未來需要修正訓練策略或引入額外的時間感知模組,才能讓多模態 AI 更好地適應長影片分析與時序導向的應用場景。
為解決現有 Video-LLM 評估常依賴語言結構且易產生捷徑的問題,研究團隊提出 TempCloze 新基準,以純視覺影片填空方式測試模型的時間推論能力。
- TempCloze 整理了 1,521 個來自七個來源的影片(主要為長鏡頭與第一人稱視角),並在基礎上設計了包含語義、對齊與程序三維度的同源幹擾項。
- 實驗涵蓋 10 個專有與 21 個開源的 Video-LLMs,發現儘管模型能理解語義內容,但在「時間對齊」與全域故事流把握上表現不佳,仍是主要誤差來源。