SLCA-GRPO:解決工具呼叫 RL 中的跨段位信用錯配問題
為何重要
當前 Agentic workflow 效能受限於 Reward signaling 的結構性缺失,SLCA-GRPO 提供了修正 Credit misattribution 的具體技術路徑,有助於縮短 Agent 課後訓練的收斂時間並提升決策穩健度。這項技術對於高度依賴多步驟決策的產業應用(如金融分析、自動化客服)具有重要的實務轉化價值,能直接降低部署成本與失敗率。
由於工具呼叫代理混合生成自然語言摘要與結構化 Tool invocations,標準 GRPO 演算法會將 Trajectory-level 的 Advantage indiscriminately 廣播,導致 Gradient noise 影響工具決策;本研究提出 SLCA-GRPO 框架,引入 Segment-Locked Credit Assignment (SLCA) 來解決跨段位信用錯配問題。
- 研究提出 Schema-Guided LLM Simulator (SGLS) 作為訓練基礎設施,在建構本體論的 Exploration 時大幅降低成本。
- SLCA 機制在單一 Rollout 群組內解耦 Advantage estimation,並以 Hierarchical Rewards (HierR) 在結構段位間路由優勢。
- 在 7B backbone 上使用相同訓練預算時,相比標準 GRPO、ToolPO 與 RLTR,BFCL 效能增加 +1.36 pp,$ au^2$-Bench 增加 +9.15 pp。