當 LLM 代理慢下來時:透過 Elo-per-token 分析理解代理的測試時間策略
為何重要
這項研究量化了 LLM 代理「過度擴充套件計算量」的效能邊界,揭示了計算策略從「堆疊 tokens」轉向「策略性分片」的優勢。對開發者而言,這意味著在解決複雜任務時,需要設計機制來避免無效的重試與耗費昂貴的 tokens。對產業而言,它挑戰了「算力越多越好」的普遍迷思,促使企業更精準地投資於能最佳化測試時間計算的框架。
由於 LLM 代理會動態分配測試時間並重試,導致難以衡量其擴充套件性,研究團隊提出「Elo-per-token 分析」來量化這種轉換。
- 研究利用 Bradley-Terry 模型,將
100M tokens的會話預算轉換為多個開放式任務中各代幣對應的 Elo 等級分。 - 實驗結果顯示,代理初期雖然提升 Elo 的速度快於獨立取樣的參考基準(線性關係),但邊際收益最終會遞減甚至低於參考基準。
- 在 FrontierCS Polyomino Packing 任務中,將
100M tokens改為分散至十個短會話後,獲得的 Elo 分數(+355)比單一長會話(+264)增加了 91 分。