樣本數還不夠:候選生成策略模塑 LLM 測試時間擴張的能耗與效能
為何重要
此研究揭露了 LLM 產業長期對試算資源消耗的誤判,證明在實務部署測試時間擴張策略時,「批次大小」是比「樣本數量」更關鍵的工程引數。對於開發者與雲端服務營運者而言,這意味著若維持相同準確率,最佳化批次執行可大幅降低電費與延遲;僅追蹤樣本數而不看執行架構,將導致資源配置與成本估算的嚴重偏差。
LLM 測試時間擴張透過生成並整合多個候選回應來提升推理能力,但實際執行策略直接決定系統資源消耗與延遲。研究指出,僅追蹤候選樣本數量($N$)不足以評估成本,批次化與串列執行同樣數量樣本的效果截然不同。
- - 在 Phi-3-mini 與 Qwen2.5-1.5B 上的 GSM8K 測試顯示,當樣本數 $N$ 從 1 增至 8 時,前者準確度提升 8.4%,後者提升 18.4%。
- - 在 A100 GPU 上固定候選數 $N=8$,若改為 8x1(8 次串列呼叫)而非 1x8(1 次批次呼叫),總能耗會增加 4.64–4.86 倍,P95 延遲增加 5.77–6.12 倍。
- - 當候選樣本彼此獨立且記憶體允許時,批次較大的較少呼叫在執行上更為高效,評估報告應一併納入生成排程與 GPU 指標。