Zero-Mem:針對 LLM Agent 的零 Token 記憶運算
為何重要
Zero-Mem 顛覆了多數 Agent 架構中「記憶操作必須耗費 LLM 資源」的舊思維,透過結構化圖與時序層級處理互動軌跡,大幅降低延遲與成本,為高效能、低延遲的 Agent 系統提供了新的設計範式。 對開發者而言,這代表可以更輕鬆地建構處理長期記憶的 Agent 而不會背負高昂的 API 成本;對於監控長程式或需要上下文黏著度的商業應用,這種方法能有效提升可靠性與即時性。
LLM Agent 在長時間的互動中需要記憶維持一致性,但現行系統常透過額外的 LLM 呼叫來操作記憶,導致產生不必要的 token 消耗與時間成本,且過程中資訊遺失可能影響原始證據的正確性。
- Zero-Mem 提出零 Token 記憶運算(zero-token memory operations):除了最終的問答階段外,不會在記憶操作中觸發任何 LLM 呼叫或消耗 token。
- 該系統利用兩個互補的檢視來組織互動線索:跨互動的實體—上下文圖與保留對話區域性性的時間層級,藉此呈現結構化的記憶體。
- 在長記憶與長上下文問答基準測試中,Zero-Mem 相比最快的基準方法,將記憶操作時間成本降低了 57.6%。