技能自我對弈:透過協同演化技能推進 LLM 能力邊界
為何重要
此解決方案有效解決了目前自主 Agent 訓練中標註成本高昂與驗證受限的痛點,提供了一種自動化重新整理 LLM 能力邊界的範式。對於開發者而言,這代表未來最佳化 Agent 能力可能不再依賴海量人工標註,而是透過這種自我對弈機制自動產生訓練資料,大幅降低技術門檻。
LLM 訓練正從手動設計與註釋轉向互動式自演化,但現有方法面臨任務多樣性與驗證可靠性的根本兩難。新框架提出藉由「技能」作為中介橋樑,連結環境繫結方法的精準回饋與開放式自生成方法的廣度,實現結構化驗證與開放式探索的平衡。
- 引入 Skill Self-Play (Skill-SP) 架構,包含 Proposer(提議者)、Solver(求解者)與 Skill Controller(技能控制器),透過強化學習迴路進行協同演化。
- 在工具使用與推理基準上的實證評估中,Skill-SP 一致推動表現優異模型的效能上限,並能對初始對齊誤差的模型造成顯著表現逆轉。
- 技能作為執行橋樑,確保了模型在特定情境中的深度且可驗證執行,同時動態路由維持開放式任務多樣性。
- 相關原始碼已開源,供研究人員進行實證評估與套用:https://github.com/Qwen-Applications/skill-self-play。