ReactVAU:流式視訊異常理解的慢-快解耦框架
為何重要
此架構精準對齊了商業安全與即時監控對「強因果性」的根本需求,改變了多模態 AI 在現場部署的運作模式——從「全時運算」轉向「按需精算」;對開發者而言,它提供了一個在不犧牲描述深度的前提下,控制 MLLM 運算成本的有效範本。
ReactVAU 面向即時監控場景,提出一種慢速-快速解耦架構以解決現有視訊異常理解(VAU)方法的兩大痛點:傳統離線推論違反即時監控所需的因果性,而通用流式模型常因稀少訊號被壓縮遺漏,或在不必要時頻繁啟動重模組。
- 架構包含輕量級快速檢測模組(基於 Spatial Grid Folding, SGF)、能抵抗時間衰減的感知異常的持久記憶(AAPM),以及僅在被可疑事件觸發時喚醒的重型慢速推理模組。
- 實驗結果顯示,該框架在多個基準測試中嚴格符合流式約束,並透過最小化重型 MLLM 呼叫次數來大幅提升計算效率。
- 專案頁面:https://huiyuiui.github.io/React_VAU/