ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

強化學習推動代理程式技能逐步生成

工具 1 個來源 · 2 天前
為何重要

過往代理程式技能多依賴人工設計或啟發式規則,泛化性有限;Skill-α 提供了一種標準化的自動化手段,解決了在下游任務表現不變時仍需判斷技能有效性難題,顯著優化了代理的行為準確度。 對於開發者而言,這代表建立高階 Agent 時的技能庫擴充效率將大幅提升,有助於加速具身智慧或自主工作流程的建構。

針對代理程式技能生成缺乏監督訊號的挑戰,研究提出 Skill-α 方法,將技能建構視為循序編輯過程並引進回滾獎勵機制。

  • 提案將技能生成轉化為順序編輯過程,並透過「回滾獎勵」比較原始與編輯後的技能在錨定查詢下的下游執行結果,以評估編輯效益。
  • 在 GPT-4o 作為 worker 的設定下,Skill-α 的下游平均成功率在 CL-Bench 上比最佳基準高出 3.3 分,在 tau2-bench 上高出 6.7 分。
  • 大量消融實驗驗證了回滾獎勵機制與漸進式生成策略對於提升代理技能效能的關鍵重要性。
Reinforcement LearningSkill-αAgentGPT-4oCL-Benchtau2-bench

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00