超網路於大語言模型訓練階段注入事實知識的擴充套件法則
為何重要
這項研究從理論層級驗證了超網路作為訓練時知識注入底層結構的優勢,意味著企業可能透過更輕量的「生成式 adapter」來強化模型的事實準確性,而非耗資巨大的全量微調。 不同於現有的 RAG(檢索增強生成)方法,超網路在生成 adapter 時即內化了知識,這對於需要高整合度與低延遲的應用場景具有潛在價值。 資料工程師與架構師值得關注此技術如何改變 LLM 知識更新的工作流程,以及在試圖解決長尾知識落實困境時的可能性。
研究者提出利用超網路在訓練時生成固定的 LoRA adapter,以此將大規模真實世界事實注入目標大語言模型,打破了以往僅限於測試時適配的框架。
- 研究建構了稱為 MegaWikiQA 的大規模資料集,從 Wikidata5M 提取出涵蓋 39 個領域的數千萬個多跳問答範例。
- 證實超網路在架構軸向(深度、寬度等)呈現出預測性的隨機擴充套件行為,且在分佈外泛化效能上,其擴充套件指數顯著高於 LoRA 微調與全量微調。