MoME:具語境感知能力的稀疏檢索記憶混合方法
為何重要
傳統記憶嵌入方法缺乏語境感知,導致多義詞表示崩塌。MoME 引入語境 Aware 的路由機制,解決了 LLM 在擴充套件記憶容量時常見的訊息損耗問題。其在 sub-billion 規模下的優異縮放趨勢,為資源受限的邊緣 AI 與輕量級模型提供了一種高價效比的儲存擴充套件方案,進一步印證了混合記憶與稀疏計算在模型設計上的可行性。
為了有效擴充套件大型語言模型(LLM),訓練圈引入了稀疏容量機制,包括 Mixture-of-Experts 與條件式記憶(Token-indexed embedding tables)。現有方法依據字面形式檢索,導致多義詞(如程式語言 vs. 動物)被壓縮為單一表示。
- MoME (Mixture-of-Memory Embeddings) 將 token 的單一記憶列替換為 M 個槽的混合,並利用學習到的 gate 機制依據隱藏狀態(hidden state)來選擇讀取的槽位。
- 在 nanochat、Llama-3/MobileLLM、Qwen3 backbone 上的控制預訓練實驗中,MoME 在 iso-parameter 與 iso-training-FLOP 設定下優於 Value Embedding、Bigram、STEM 基線。
- MoME 在 sub-billion 規模下展現出更佳的記憶大小縮放趨勢,且維持了高效的訓練和推理成本。
- 質化路由分析指出,學習到的混合機制具備語義解釋性,能根據語境不同將相同字位分派至不同記憶槽。