確認 LLM Agent 是否能演進技能的新基準測試:ContinualSkillBench
為何重要
研究揭示了當前 LLM Agent 演化機制的核心瓶頸,即在缺乏頂尖模型輔助時,系統容易陷入「零碎技能」的收集而非「高階重用技能」的提煉。這資料對開發者產生直接影響,顯示架構設計不能僅依賴技能庫的疊加,必須重視情境適應與任務間的技能遷移邏輯。
為檢驗現代 Agent 框架是否能讓大型語言模型透過外掛技能庫真正提升任務解決能力,研究團隊推出了「ContinualSkillBench」動態評估框架。
- 框架涵蓋 5 個代表領域,每個領域包含 100 個循序遞增難度且具備跨任務技能複用機會的互連子任務。
- 實驗發現情境學習的平均表現等同於明確的技能維護,其進步主要來自對背景上下文與反饋的適應。
- 能力較低的模型傾向於累積較大且零碎的專屬任務技能,顯示當前機制仍難以將經驗整合為穩健且易遷移的技能。