TurnSight:工具整合推理的回合層級事後自我監督框架
為何重要
解決了現有 RL 方法在處理長期工具互動時精準歸因不佳的痛點,透過修正監督訊號結構來提升 Agent 訓練的穩定性與效能。雖然目前屬於底層演算法最佳化,但這類技術會是未來發展高水平自主 Agent 的關鍵積木。
雖然工具整合推理 (TIR) 讓 LLM 透過迭代工具互動能解決複雜任務,但現有的強化學習方法僅依賴軌跡層級監督,導致在長期場景下難以進行精細的歸因,且舊式方法無法反映代理實際訪問的狀態。
- 提出名為 TurnSight 的回合層級事後自我監督框架。
- 直接從「執行情況-依存的 hindsight」衍生監督訊號,而非依賴地面真相或被動獲取的技能。
- 透過跨視野方向一致性篩選可靠訊號,並在兄弟輪次中進行標準化。
- 在「三個基準」上驗證了有效性,程式碼已釋出至 GitHub。