ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SLCA-GRPO:解決工具呼叫 RL 中的跨段位信用錯配問題

研究 1 個來源 · 1 小時前
為何重要

當前 Agentic workflow 效能受限於 Reward signaling 的結構性缺失,SLCA-GRPO 提供了修正 Credit misattribution 的具體技術路徑,有助於縮短 Agent 課後訓練的收斂時間並提升決策穩健度。這項技術對於高度依賴多步驟決策的產業應用(如金融分析、自動化客服)具有重要的實務轉化價值,能直接降低部署成本與失敗率。

由於工具呼叫代理混合生成自然語言摘要與結構化 Tool invocations,標準 GRPO 演算法會將 Trajectory-level 的 Advantage indiscriminately 廣播,導致 Gradient noise 影響工具決策;本研究提出 SLCA-GRPO 框架,引入 Segment-Locked Credit Assignment (SLCA) 來解決跨段位信用錯配問題。

  • 研究提出 Schema-Guided LLM Simulator (SGLS) 作為訓練基礎設施,在建構本體論的 Exploration 時大幅降低成本。
  • SLCA 機制在單一 Rollout 群組內解耦 Advantage estimation,並以 Hierarchical Rewards (HierR) 在結構段位間路由優勢。
  • 在 7B backbone 上使用相同訓練預算時,相比標準 GRPO、ToolPO 與 RLTR,BFCL 效能增加 +1.36 pp,$ au^2$-Bench 增加 +9.15 pp。
RLTool-CallingSLCA-GRPOSGLSHierarchical RewardsAgent

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00