從影片自監督學習結構化動態:SDM 模型解耦運動訊號
為何重要
研究確認預訓練的圖片模型能輕鬆轉用為結構化影片動態表示,解決了視覺 AI 中區分攝影機與物體運動的根本難題,這為提升自動駕駛、機器人視覺及 AR/VR 逼真度提供了基礎技術驗證。
影片中的運動訊號混雜了攝影機與物體兩種動態,難以分離;研究提出「結構化動態模型」,利用預訓練圖片模型的特徵透過「未來特徵預測」來區分主要時間變化與殘餘動態。
研究確認預訓練的圖片模型能輕鬆轉用為結構化影片動態表示,解決了視覺 AI 中區分攝影機與物體運動的根本難題,這為提升自動駕駛、機器人視覺及 AR/VR 逼真度提供了基礎技術驗證。
影片中的運動訊號混雜了攝影機與物體兩種動態,難以分離;研究提出「結構化動態模型」,利用預訓練圖片模型的特徵透過「未來特徵預測」來區分主要時間變化與殘餘動態。