Cache-to-Cache:大型語言模型間的直接語意通訊
為何重要
這項突破意味著模型間不再是漫無目的地產生文字 Prompt 來轉達訊息,而是直接在低階向量狀態(KV-Cache)層級交換「顯著特徵」,這可能大幅降低多模型協同部署的成本與延遲,是未來構建高效能 AI Agent 的關鍵底層技術進展。
現有的多語言模型系統主要透過文字序列進行溝通,不僅會遺失豐富語意,還會產生逐一生成 Token 的延遲。本研究提出 Cache-to-Cache(C2C)架構,讓 LLM 直接融合彼此的 KV-Cache 以達成低延遲、高品質的語意傳輸。
- C2C 使用神經網路投影與融合源模型的 KV-Cache,並透過可學習的閘控機制挑選目標層級。
- 相較單一模型,C2C 將平均準確度提升了 6.4% 至 14.2%。
- 比起文字通訊模式,C2C 平均降低 2.5 倍延遲,準確率則高出 3.1% 至 5.4%,同時避免顯式的文字中繼步驟。