ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

LAMAR:具語言感知能力的開源多語言重排序模型

研究 1 個來源 · 10 天前
為何重要

語言連貫性是影響多語言 RAG 系統可靠度的關鍵因素,LAMAR 修補了現有多語言模型過度偏重語意重疊而忽略語言穩健性的問題。對於在中國市場等非英語環境部署應用的開發者來說,這項技術能顯著提升資訊檢索的準確性與使用者體驗。

在多語言檢索增強生成(RAG)應用中,現有重排序模型常忽略回傳文件的語言一致性,導致最終輸出不符合自然語言邏輯。本研究提出 LAMAR,一個專注於同時最佳化語意相關性與語言連貫性的開源 Cross Encoder 重排序模型。

  • LAMAR 採用兩階段訓練策略:利用「English anchored relevance distillation」(英語為基礎的相關性知識萃取)建立跨語言一致的評分基準,並透過偏好對齊(preference alignment)強制提升與查詢語言相同的文件排名。
  • 在針對語言連貫性設計的受控實驗中,LAMAR 在所有個別測試語言上都取得了最佳表現。
  • 在實務檢索設定中,LAMAR 在重排序第一階段獲取的候選清單時,針對所有報告指標均取得最佳結果。
LAMARRAGRetrieval Augmented GenerationMultilingualOpen SourceNLP

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00