Wnuan:專有企業知識問答的分階段後訓練方法
為何重要
針對企業私有資料的微調常面臨災難性遺忘與通用能力下降的兩難,Wnuan 提供了一種平衡精度與通用性的系統性解決方案。 對於 RAG(檢索增強生成)與企業內部 Agent 的開發者而言,這項技術能顯著提升問答準確率;對產業投資人,這顯示開源模型正透過更細緻的訓練策略(如混合取樣)深化在 B2B 市場的競爭力,可能改變企業級 AI 軟體的部署成本結構。
為了讓模型在不丟失通用能力的情況下掌握企業專有知識,研究提出名為 Wnuan 的三階段後訓練管道。
- 方法包含:從檔案建構任務監督、使用通用資料回放進行 SFT(指令微調)、並對殘差錯誤應用強化學習。
- 在 707 題的 WnuanBench 上,大型 32B 路徑將可接受答案率 (AAR) 從適配前的 52.76% 顯著提升至 RL 後的 91.51%。
- 殘差錯誤取樣在匹配協議下優於全池取樣及同規模隨機取樣,分別高出 3.11 和 2.97 點,且 90.5% 的回應樣本與領域專家判定一致。