RelateAnything:從任意輸入即時進行開放詞彙關係預測
為何重要
這項研究標誌著場景圖生成技術從「有監督的封閉式模型」邁向「開放詞彙的高彈性架構」的一步,使模型能夠適應任何謂詞表而無需重新訓練,大幅提升了系統的通用性。對產業而言,它證明專門化的輕量模型(53M 引數)在特定任務上可擊敗龐大的基礎模型(3B);此外,公開發布的 RA-4M 資料集與 OV-SGG-Bench 基準也為學術界和業界提供了高品質且可驗證的訓練素材。
場景圖生成(SGG)長期以來受制於固定檢測器和詞彙表,本篇研究提出 RelateAnything 模型打破此限制,將詞彙表邏輯從模型訓練轉移為推理時輸入,實現真正的開放詞彙。
- 新模型僅含 53M 引數,推論速度達 20 ms/frame。
- 採用自建的 RA-4M 資料集,包含 474k 張圖片與經幾何驗證的 4.3M 個關係,涵蓋 10,102 種自由文字謂詞。
- 在同規模開放詞彙方法的基準上,平均召回率高達 2.3-3.5 倍,且即使只有強大 3B-VLM 模型不到 2% 的引數量,其表現仍能領先該模型。