PANORAMA:透過遮罩提案選擇進行全域性畫素化描述
為何重要
此技術突破強化了視覺語言模型(VLM)從「看圖」進階到「看懂場景與精準歸屬」的能力,特別是在背景理解與多例項關聯上具顯著優勢,有助於提升自動化感知與互動系統的準確性;同時提出的 gPQ 指標為未來評估多模態模型的地面化能力提供了更精確的標準。
現有的視覺語言模型雖能生成流暢且詳細的影像描述,但在將敘述可靠地對應到具體畫素上依然困難,且現行方法常發生描述不完整或遮罩不準確的狀況。研究團隊提出 PANORAMA 模型,透過「泛全景地面化描述」任務,解決背景區域與前景物件的同時識別與歸屬問題。
- 新增 PanoCaps 基準測試資料集,源自全景分割資料集,具備高密度的描述與接近完整的畫素覆蓋率。
- 提出短語-遮罩匹配協議與泛化泛全景品質(gPQ)指標,用於聯合評估文字敘述與分割遮罩的一致性。
- PANORAMA 將預訓練分割器條件化於上下文化短語表示上,並透過聯合訓練允許參考短語對應單一或多個例項區域。
- 研究開原始碼、資料與模型,並在 PanoCaps 基準上獲得最佳整體地面化效果。