ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

樣本數還不夠:候選生成策略模塑 LLM 測試時間擴張的能耗與效能

研究 1 個來源 · 4 天前
為何重要

此研究揭露了 LLM 產業長期對試算資源消耗的誤判,證明在實務部署測試時間擴張策略時,「批次大小」是比「樣本數量」更關鍵的工程引數。對於開發者與雲端服務營運者而言,這意味著若維持相同準確率,最佳化批次執行可大幅降低電費與延遲;僅追蹤樣本數而不看執行架構,將導致資源配置與成本估算的嚴重偏差。

LLM 測試時間擴張透過生成並整合多個候選回應來提升推理能力,但實際執行策略直接決定系統資源消耗與延遲。研究指出,僅追蹤候選樣本數量($N$)不足以評估成本,批次化與串列執行同樣數量樣本的效果截然不同。

  • - 在 Phi-3-mini 與 Qwen2.5-1.5B 上的 GSM8K 測試顯示,當樣本數 $N$ 從 1 增至 8 時,前者準確度提升 8.4%,後者提升 18.4%。
  • - 在 A100 GPU 上固定候選數 $N=8$,若改為 8x1(8 次串列呼叫)而非 1x8(1 次批次呼叫),總能耗會增加 4.64–4.86 倍,P95 延遲增加 5.77–6.12 倍。
  • - 當候選樣本彼此獨立且記憶體允許時,批次較大的較少呼叫在執行上更為高效,評估報告應一併納入生成排程與 GPU 指標。
LLMTest-time scalingPhi-3-miniQwen2.5-1.5BEnergy efficiencyGSM8K

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00