學習失敗:透過硬負樣本實現統一多模態檢索的檢索導向鏈式思維
為何重要
該研究跳脫傳統以查詢驅動推理的框架,轉向利用檢索反饋來強化模型辨識能力的設計,為解決多模態 RAG 應用中檢索精準度不足的痛點提供了新技術視角,對開發者最佳化資料庫與 Agent 側的檢索鏈路具有重要參考價值。
統一多模態檢索旨在識別滿足複雜使用者意圖的候選項,現有的 LVLM 方法常因遺漏細緻差異線索,導致語義相似的候選對出現混淆。
- 研究主張檢索推理應條件化於檢索反饋,而非僅源自查詢本身。
- 提出 UniME-R1 框架:顧問會個別分析初選候選項以定位被嵌入器誤判的細節;若目標在 top-k 中則直接重排序,否則生成檢索導向鏈式思維 (RC-CoT) 並透過雙模式嵌入器 全量重新檢索。
- 訓練過程透過挖掘硬負樣本模擬失敗,並配合監督學習與檢索導向強化學習 (RRL) 對齊顧問與檢索結果。