Ambient @ EgoLongQA 2026:將長影片感知領縮小至次 2B 模型
為何重要
此研究展示了將長影片感知能力納入輕型 Edge 裝置部署的可行性,證明瞭特定模組的知識蒸餾與無損修剪是平衡效能與推理成本的關鍵技術路徑。對於 Wearable AI 領域的開發者而言,這提供了一個可複製的高效率架構範例。
團隊參加 ECCV 2026 Wearable-AI Challenge 的 EgoLongQA 追蹤,開發了一款單一視覺語言模型,能在一次推論中回答關於十分鐘第一人稱影片的問題,並在 ≤2B 引數組別以 0.8279 分獲得第一名。
- 模型透過濾選教師管道中回答正確的軌跡進行知識蒸餾,僅用 1.1% 的引數(1.9985B)即達到 89% 的效能,將準確率從基準的 27.1% 提升至 81.4%。
- 為符合引數限制,研究團隊將總引數 2.2132B 的 backbone 進行多語言嵌入表格修剪,並透過可證明完全相同的聽證數值確保壓縮後的精度。