環境即腳手架:豐富反饋以啟動長期任務的自發進化智慧體
為何重要
這項研究對於克服 LLM Agent 領域的核心難題至關重要,將「環境設計」從被動的指令碼角色升級為主動的協助推手。 - 解決了訓練長期任務智慧體時「不知如何給予回饋」的痛點,並為 Qwen3 生態展示了在複雜規劃任務上的擴充套件潛力。 - 產業觀點:最佳化 Agent 的「探索穩定性」與「內化學習機制」,正成為超越基礎模型能力的關鍵差異化技術。
大型語言模型雖擅長靜態推理,但訓練其作為長期任務的自主智慧體時,常受制於強化學習中「獎勵稀疏」的嚴重缺陷。
- 研究提出將學習焦點轉移至環境側,建立「豐富反饋環境(FEE)」架構,透過轉換指導策略,將後期階段的行動指導轉為觀察豐富化。
- 在 SciWorld 與 BFCL 基準測試中,使用不同規模的 Qwen3 模型搭配 GRPO、GSPO 及 DAPO 等演算法進行大規模實驗,一致顯示 FEE 優於標準設定。
- 資料分析證實,這種方法能有效穩定訓練動態(降低熵波動)、促進困難任務的狀態空間探索,並將環境指導內化至 policy weights。