多模態大型語言模型(MLLM)細緻感知的區域級政策最佳化與 Token 效率提升
為何重要
這項技術挑戰了多模態大型語言模型「解析度越高越好」的傳統最佳化直覺,透過聰明的資源重分配,顯著降低了推理成本與延遲,對需在資源受限環境(如邊緣裝置)部署高階 LLM 的開發者與廠商具有重要意義。未來這類基準的降低有望成為評估 MLLM 產品效能與商業可行性的關鍵指標。
- 改善細緻感知的傳統方法涉及提升解析度,但會增加視覺編碼與語言模型前置填入成本。
- 據控制診斷,定位興趣區域可耐受約 3 至 4 倍的 Token 壓縮,識別則需要更高解析度,因此採用從粗略檢視進行定位。
- Vision-RL2 使用區域級強化學習,在凍結 MLLM 閱讀器的評分下,以移除幹擾與補回遺漏證據作為目標,無須標註。
- 實驗在六個細緻感知基準與四種 MLLM 架構上驗證,於減少約 4 倍視覺 Token 的情況下,其準確率超越基礎模型的最大預算表現。