ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

tokenizers v1:編碼、解碼與擴充套件性的實測

工具 1 個來源 · 1 天前
為何重要

對部署 LLM 的開發者與工程團隊而言,這項最佳化直接降低了 RAG 系統或即時推理服務的預處理延遲,能有效減少併發請求等候 GPU 的時間。雖然技術屬於工具鏈的底層創新,但對於追求邊緣部署或高成本效益的企業來說,是顯著降低單次請求資源消耗的實務改進。

Hugging Face 釋出 tokenizers v1,將原本輕量的序列化步驟轉化為高效的效能重點,透過底層演算法與記憶體使用最佳化,解決大型模型訓練與高並發服務下 Tokenization 的瓶頸問題。

  • 以手寫分割函式取代通用正規表示式引擎,利用 CPU SIMD 指令集(如 Bitcannon)於 64 位元一組處理,顯著加快預先分割(pre-tokenize)流程。
  • 引入執行緒區域快取,當輸入包含重複文字時,直接從快取回應而不需重新執行 BPE(Byte Pair Encoding)合併迴圈。
  • 在 Apple M4 Max 單執行緒環境下測試,v1 與 v0.23 相比整體速度提升 3 到 30 倍,跨多執行緒時延展性達線性的約 76%。
tokenizersHugging FaceBPESIMDPythonLLM

來源 · 1 篇報導

首發 Hugging Face Blog huggingface.co 08:00