ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

當 LLM 代理慢下來時:透過 Elo-per-token 分析理解代理的測試時間策略

研究 1 個來源 · 8 天前
為何重要

這項研究量化了 LLM 代理「過度擴充套件計算量」的效能邊界,揭示了計算策略從「堆疊 tokens」轉向「策略性分片」的優勢。對開發者而言,這意味著在解決複雜任務時,需要設計機制來避免無效的重試與耗費昂貴的 tokens。對產業而言,它挑戰了「算力越多越好」的普遍迷思,促使企業更精準地投資於能最佳化測試時間計算的框架。

由於 LLM 代理會動態分配測試時間並重試,導致難以衡量其擴充套件性,研究團隊提出「Elo-per-token 分析」來量化這種轉換。

  • 研究利用 Bradley-Terry 模型,將 100M tokens 的會話預算轉換為多個開放式任務中各代幣對應的 Elo 等級分。
  • 實驗結果顯示,代理初期雖然提升 Elo 的速度快於獨立取樣的參考基準(線性關係),但邊際收益最終會遞減甚至低於參考基準。
  • 在 FrontierCS Polyomino Packing 任務中,將 100M tokens 改為分散至十個短會話後,獲得的 Elo 分數(+355)比單一長會話(+264)增加了 91 分。
Elo-per-tokenLLM AgentsBradley-Terry modelFrontierCSTest-time compute

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00