OneDayAgent:邁向自主 Agent 的長期 Harness
為何重要
該研究聚焦於 Agent 架構中的 'Harness'(框架)層,證明透過系統性的任務分解與執行記憶管理,可以有效提升 Agent 在複雜長期情境下的行為穩定性。對於產業而言,這證實了超越特定單一模型最佳化的必要性,驗證了 Agent 管理平臺的技術價值與市場潛力。
為瞭解決 LLM Agent 在執行開放式、多模態且長期任務時的目標維持與語境擁塞問題,研究團隊提出了 OneDayAgent 這個長期 Harness,將開放式請求轉化為受管理的執行流程。
- 在 AgentIF-OneDay 基準上針對 104 個任務進行了評估。
- 使用 GLM-5.2 後端時達到了 0.821 的新最高分。
- 在來自三個模型家族的五個後端 LLM 上執行時,表現出優異的後端通用性,無需調整。