從 Agent 經驗中進行樣本高效學習
為何重要
此研究解決了高成本環境互動的痛點,透過將語境式學習轉化為權重內化,大幅降低訓練資源需求,對 Robotic、軟體工程與遊戲 AI 領域具實質貢獻。 對產業而言,這代表企業在部署複雜 Agent 時,無需進行大量高耗能的環境打點即能具備高準確度,是推動 Agentic AI 落地的重要技術突破口,值得關注其在多模態任務中的擴充套件性。
針對真實世界 Agent 訓練中高成本的環境互動問題,研究者提出 "Experience Distillation" 方法,讓 Agent 能直接從過往互動歷史中萃取經驗並內化至模型權重,避免額外新互動。
- 在 749 種軟體工程任務與 6 個文字冒險遊戲中,保留了 In-context learning 至少 64.8% 的效能增益。
- 達到經典 Reinforcement Learning 基準樣本需求減少 9.6 倍的效果,遠勝於直接在歷史資料上進行 Supervised Fine-tuning 的 3.8%。