更好、更強、更快、更廣:解決 MLLM 分割三難困境的結構化全掩碼預測
為何重要
此研究成果標誌著多模態大型語言模型正從單純的文字理解能力,邁向具備密集視覺任務處理能力的混合專家模型,意義在於消除了傳統「語言模型」與「分割模型」雙模組併行的複雜度。對開發者而言,這代表可在單一檢查點(checkpoint)中同時保留指代與推理能力,簡化模型部署流程;對產業鏈而言,這種高效的非自迴歸架構(約降低 60% 推論延遲)若能應用於醫療影像或即時視訊分析,將具備顯著的算力優勢與成本削減潛力。
針對多模態大語言模型(MLLM)在影像分割任務中難以同時達成高精度、保留多模態對話能力以及快速推論的「分割三難」問題,研究提出了一套稱為 STAMPlus 的解決方案。
- 舊方案 STAMP 採用一次性混合注意力將標記分類為前景或背景,開啟了非自迴歸框架的可能性。
- 新一代 STAMPlus 生成包含明確 ID 與可選框的目標列表,並將其對映至共享的多類掩碼空間,支援開放詞彙語義、例項感知及遙感小目標分割。
- 在效能測試中,STAMPlus 將 12 類別的推論延遲從 STAMP 的 13.50 秒顯著縮減至 5.16 秒。