獎勵模型評分速度系統研究:C++、PyTorch 與 ONNX Runtime 的效能比較
為何重要
這項實證研究打破了 RLHF 實作常依賴 PyTorch eager mode 或 torch.compile 的慣例,揭示在 CPU 優先的場景下,ONNX Runtime 配合原生 C++ 引擎能有顯著的系統層級加速,且批次處理最佳化是比模型微調更關鍵的效能驅動因素。
在 RLHF 流程中,獎勵模型評分速度常被視為政策更新的延遲瓶頸,研究團隊利用 ONNX Runtime 建構原生 C++ 推斷引擎,並與 PyTorch eager mode、torch.compile 及 FastAPI 進行系統層級的效能對比。
- 在 CPU 環境下,該引擎在各項基準測試中全面勝出,且置信區間與 PyTorch eager、torch.compile 及 FastAPI 均不重疊。
- 正確性驗證顯示,其輸出與 PyTorch 參考模型在 CPU 端的誤差僅為 5.7 x 10^-6,GPU 端約為 4.2 x 10^-3。
- 儘管引擎在 GPU 端優於 PyTorch 與 FastAPI,但 torch.compile 反而更快;研究特別指出批次策略的影響超過語言或執行環境的選擇。