ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

環境即腳手架:豐富反饋以啟動長期任務的自發進化智慧體

研究 1 個來源 · 14 天前
為何重要

這項研究對於克服 LLM Agent 領域的核心難題至關重要,將「環境設計」從被動的指令碼角色升級為主動的協助推手。 - 解決了訓練長期任務智慧體時「不知如何給予回饋」的痛點,並為 Qwen3 生態展示了在複雜規劃任務上的擴充套件潛力。 - 產業觀點:最佳化 Agent 的「探索穩定性」與「內化學習機制」,正成為超越基礎模型能力的關鍵差異化技術。

大型語言模型雖擅長靜態推理,但訓練其作為長期任務的自主智慧體時,常受制於強化學習中「獎勵稀疏」的嚴重缺陷。

  • 研究提出將學習焦點轉移至環境側,建立「豐富反饋環境(FEE)」架構,透過轉換指導策略,將後期階段的行動指導轉為觀察豐富化。
  • 在 SciWorld 與 BFCL 基準測試中,使用不同規模的 Qwen3 模型搭配 GRPO、GSPO 及 DAPO 等演算法進行大規模實驗,一致顯示 FEE 優於標準設定。
  • 資料分析證實,這種方法能有效穩定訓練動態(降低熵波動)、促進困難任務的狀態空間探索,並將環境指導內化至 policy weights。
Qwen3RLSelf-Evolving AgentsFEELong-Horizon Tasks

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00