O-VAD:利用物件中心化追蹤與推理的工業影片異常偵測
為何重要
現有的製造業 AI 解決方案往往受制於資料標註成本與場景適配難度,O-VAD 的訓練自由特性解決了需大量針對特定工廥重訓的痛點。對製造業決策者而言,這代表了在不增加昂貴標註預算下提升自動化品管的可能性;對開發者來說,這建立了以「物件動態」為核心的 Agentic AI 在工業監控領域的新範式。
工業影片異常偵測(IVAD)作為現代製造與品控系統的核心,旨在識別生產過程中的異常物件與事件。現有的視覺語言模型(VLM)雖然在通用領域表現優異,但在面對工業場景複雜的物理法則與程式限制時表現會衰退。研究團隊提出全新的框架,透過模擬人類檢查官的物件狀態變化,追蹤並推理異常物件。
- O-VAD 是一種不需領域知識介入的 training-free agentic framework。
- 該方法無需針對正常片段重訓,也無需在測試時注入領域知識,而是透過追蹤物件的空間時間動態與狀態軌跡來識別異常。
- 在三個 IVAD 資料集上的廣泛實驗顯示,該方法超越前沿 VLMs、現有的 agentic frameworks 以及在各自資料集上微調的傳統 VAD 方法。
- 框架能產生關於異常過程與型別的可解釋報告。