ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

AgentWorld:評估長期多代理 LLM 協作的基準測試

研究 1 個來源 · 14 分鐘前
為何重要

AgentWorld 揭示出即使是頂尖的 LLM 在多代理協作中也表現落後(成功率僅 52%),主要受制於溝通中斷與長期計畫維護的困難,這將嚴重影響具備自主能力的 AI Agents 在生成式工作流中的實用性。開發者應致力於最佳化通訊協議與持久化記憶機制,而此基準將成為衡量模型實戰協作潛力的關鍵指標。

現有的多代理檢驗多著重短期的競爭或單體表現,無法真實反映模型間的合作能力;「AgentWorld」基準試圖填補此缺口,在模擬大型多人線上角色扮演遊戲(MMORPG)的環境中,評估長期且需共享資源的複雜協作。

AgentWorldMulti-agentBenchmarkLLMGPT-5 MiniDeepSeek

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00