PAST-Bench:評量 AI Agent 遞迴自我改進基礎的基準
為何重要
此研究標誌著 AI Agent 產品化的關鍵指標從單次 Prompt 效能,轉向長期記憶與累積經驗的工程架構能力。PAST-Bench 揭示了當前架構在「儲存-檢索-更新」閉環上的缺失,Hermes+ 提供的解決方案直擊開發痛點。對投資人而言,能內建類似這種非特異性學習機制的團隊,其產品長期競爭力與使用者粘性將顯著優於單純依賴微調的競爭對手。
面對個人 AI 代理能否將累積經驗持續轉化為行為改進的關鍵問題,研究團隊推出了 PAST-Bench 進行系統性量化。
- 該基準包含 26 個場景與 204 個片段,著重測試記憶、程式重用、資訊收集以及更新能力。
- 研究在 7 個基礎模型與 4 個代理框架上對比測試,確認改進確實存在,但不同框架間的支援途徑表現不一。
- 基於發現開發的 Hermes+ 擴充了 5 項針對代理迴圈的幹預,能提升平均增益並強化替換過時狀態的任務表現。