LatentPort:超越 KV Cache 的跨模型遞迴記憶傳遞技術
為何重要
這項技術對於開發超大上下文視窗模型的企業極具啟發,可能顯著降低長上下文推理的記憶體開銷與重讀時間成本。它驗證了混合狀態(Hybrid-State)在不同規模模型間進行邏輯傳遞的可行性,挑戰了傳統 KV Cache 儲存方式的極限。然而,其僅專注於同架構姊妹模型(Geometry-matched)的使用場景,向更廣泛的異構模型遷移所需的通用狀態介面與門控機制仍在驗證中。
本研究提出 LatentPort 機制,探討混合語言模型如何在不重讀上下文字首的情況下,將即時遞迴狀態傳遞給另一個模型,以保持連續推理的效能。
- 在 Qwen3.5 的 4B 與 9B 機型間,僅翻譯注意力 KV 無法滿足需求,加入 Gated DeltaNet (GDN) 持久狀態包後,平均降低 teacher-forced negative log-likelihood (NLL) 0.747 nats/token (95% bootstrap CI [0.6921, 0.8047])。
- 測試顯示,直接重複執行遞迴與卷積狀態優於學習到的 GDN 對應,新元件「factorial」能整合翻譯的 KV 單元與直接狀態,改善資訊保留。
- 加上 434,176 引數校正後,校正版 9B 模型在零歷史字首下,原生上下文恢復 (NCR) 為 0.918,Jensen-Shannon divergence 為 0.022,L 可能略高於原生模型。