TAPe+ML v3:基於結構化表示的緊湊多工電腦視覺系統
為何重要
此研究證明瞭將建模負擔從神經網路引數轉移至結構化輸入表示,可顯著降低模型在記憶體與運算資源的需求。對開發者而言,這提供了一種在邊緣端或低算力裝置上執行複雜視覺任務的實務解方,挑戰了「小模型必低效能」的刻板印象。它強調技術重心應從純粹最佳化權重轉向更聰明的輸入表示設計,對未來的緊湊模型私有化部署具有參考價值。
TAPe+ML v3 是一種基於主動感知理論的緊湊電腦視覺系統,利用結構化表示法在識別前即編碼感知元素之間的關係。
- 系統引數量少於 100,000,透過共享識別架構支援影像分類、物體偵測與例項分割等多種任務。
- 在 COCO 基準測試中,物體偵測達到 84.7 mAP50 與 65.3 mAP50-95,例項分割為 80.7 mask mAP50 與 58.4 mask mAP50-95。
- 分類實驗顯示,於 ImageNet-Real 上獲得 89.9% Top-1 準確率,在 Imagenette 驗證集上達到 92% 正確率。
- 此方法在工業試點中驗證了在分佈偏移下的適應能力,並展示了基於原型的分類與視訊場景偵測的效能。