更小、更快、更安全:Cloudflare 大規模最佳化 Kimi 與 GLM 推論效能
為何重要
Cloudflare 的技術細節展示了邊緣運算供應商如何在硬體資源有限(主要是視訊記憶體)的情況下,透過精細的軟體工程來榨取新一代大型模型的效能。這不僅提升了開發者邊緣部署的體驗,更從商業角度展示了在不增加硬體支出的情況下,供應商可以如何維持或降低客戶的單位成本(Cost-per-token),這是邊緣 AI 市場競爭力的關鍵指標。
- KV Cache 量化:Cloudflare 將 Kimi K2.6 模型的快取預算從 16-bit 最佳化為 8-bit (FP8),允許單 GPU 在記憶體中儲存並行處理的 token 數量增加約一倍(從約 68.6 萬增至約 137 萬),在解碼階段實現約 41% 的吞吐量成長與約 30% 的成本降低。
- 模型權重壓縮:針對 GLM 5.2 模型,透過將 8-bit 權重壓縮為 4-bit (INT4),使模型體積減少約 40%(從 705 GB 降至 421 GB),讓單 GPU 記憶體佔用從約 88 GB 降至 52 GB,並額外容納約 118 萬 tokens 的快取。
- 高並發快取完整性檢查:為解決分頁注意力在高並發下的競態條件問題,Cloudflare 採用快取頁面標籤機制;測量顯示此機制對吞吐量與尾部延遲(95% 分位數)的影響低於 1%,影響可忽略不計。
- 運算階段動態最佳化:利用分離預填與解碼設計,決策在預填階段保留 FP8(計算密集最佳化)而在解碼階段使用 INT4(記憶體頻寬最佳化),前後端取其利。