ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Memory Decoder at Scale:可擴充套件的預訓練引數化長期記憶

研究 1 個來源 · 6 天前
為何重要

這項研究從技術路徑上提出了一個新的範式:提升語言模型表現可以透過增加高效的「外部記憶引數」,而非單純堆疊基礎模型的權重,這對於追求引數效率的模型架構設計具有重要啟發意義。對於開發者與基礎模型廠商(如研究主軸涉及的 Qwen 系列供應商)來說,這意味著未來發展方向可能轉向「輕量基座 + 專業記憶」的混合架構,以在不斷漲價的算力市場中壓低成本。

  • 為解決 Decoder-only 模型將記憶與推理混雜於單一引數集中難以獨立擴充套件的問題,研究提出「Memory Decoder」作為可擴充套件的引數化長期記憶模組。
  • 本研究將模型訓練至 6.9B 引數規模,並在 300B Token 資料集上進行預訓練,透過分散式 Faiss 索引與檢索管線解決大規模記憶的檢索瓶頸。
  • 實驗證明「分配引數給記憶」比「僅擴充套件基礎模型」具備更佳的引數-效能權衡;一個 6.9B 記憶搭配 Pythia-410M 的平均分數達 37.34,超越 12B 模型(37.24)並節省約 39% 總引數。
  • 對不同規模的 Qwen3 Base 模型而言,加入 1.7B 的領域記憶都能將平均分數提升超過 9 點,顯示獨立擴充套件記憶是一種通用的效能提升方案。
Memory DecoderParametric MemoryDecoder-only ModelsKnowledge ScalingSparse Loading

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00