透過檢索增強生成(RAG)運用外部知識進行歷史檔案修復:模型 ARI 提升準確度
為何重要
RAG 技術不再僅限於增強一般問答能力,而是深入到需要深厚領域知識的垂直細分市場,解決了命名實體推斷難的痛點。這展示了大型語言模型在數位人文領域的應用潛力,可能引領檔案數位化與史料修復流程的標準化重構。對於開發者而言,這是一個將通用 LLM 經驗應用於特定產業痛點的範例。
歷史檔案因物理損毀而難以辨識,傳統遮罩語言模型在修復具體命名實體時受限。本研究提出引入檢索增強生成的大型語言模型框架 ARI,將預訓練模型的隱性知識與明確檢索的外部情境結合。
- 框架名稱:作者提出名為 ARI 的新方法,利用檢索增強生成技術。
- 技術手段:結合預訓練 LLM 的隱性知識與明確檢索的外部上下文。
- 佳績表現:在韓國歷史檔案的評比中顯著優於基準線,提升一般文字與命名實體的修復率。
- 實用性:經專家評估證實,可作為加速歷史記錄分析的實用工具。