ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

獎勵模型評分速度系統研究:C++、PyTorch 與 ONNX Runtime 的效能比較

研究 1 個來源 · 7 天前
為何重要

這項實證研究打破了 RLHF 實作常依賴 PyTorch eager mode 或 torch.compile 的慣例,揭示在 CPU 優先的場景下,ONNX Runtime 配合原生 C++ 引擎能有顯著的系統層級加速,且批次處理最佳化是比模型微調更關鍵的效能驅動因素。

在 RLHF 流程中,獎勵模型評分速度常被視為政策更新的延遲瓶頸,研究團隊利用 ONNX Runtime 建構原生 C++ 推斷引擎,並與 PyTorch eager mode、torch.compile 及 FastAPI 進行系統層級的效能對比。

  • 在 CPU 環境下,該引擎在各項基準測試中全面勝出,且置信區間與 PyTorch eager、torch.compile 及 FastAPI 均不重疊。
  • 正確性驗證顯示,其輸出與 PyTorch 參考模型在 CPU 端的誤差僅為 5.7 x 10^-6,GPU 端約為 4.2 x 10^-3。
  • 儘管引擎在 GPU 端優於 PyTorch 與 FastAPI,但 torch.compile 反而更快;研究特別指出批次策略的影響超過語言或執行環境的選擇。
RLHFONNX RuntimePyTorchReward ModelInferenceSystems Study

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00