ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Hugging Face Transformers 現支援 llama.cpp 量化模型執行

模型 1 個來源 · 1 天前
為何重要

此舉大幅降低了企業及研究人員部署本地量化模型的門檻,讓開發者在熟悉 Python 生態中即可進行除錯、原型開發與效能評估,無需遷移至 C++ 執行環境。對產業而言,這一步鞏固了 Hugging Face 作為 AI 基礎設施中樞的地位,透過整合 GGUF 本地推理基準,擴大了生態系對非基礎模型架構的支援與顯著性。

Hugging Face 推出 transformers 新功能,使其能直接載入並執行 llama.cpp 社群普遍使用的 GGUF 量化模型,讓開發者能透過標準 Python API 進行本地推理。

  • 採用 llama.cpp 的 ggml 核心與 kernels 庫支援 Apple Silicon (Metal) 推理,參考硬體為 MacBook Pro M2 Max(32GB 統一記憶體),測試中代幣生成速率接近 llama.cpp。
  • 標準化流程改為透過 from_pretrained(gguf_file="...") 載入,需搭配兩個最新版本 PyTorch 及 kernels 庫,適用於各類 GGUF 格式檢查點(如 unsloth 或 LM Studio 發布的版本)。
  • 除鍵盤輸入外,支援語音標記與 OpenAI 相容 API,並提供自訂正則運算式與引數選項供開發者透過 Python 進行模型檢查點轉換除錯或微調。
transformersllama.cppGGUFHugging FaceApple Siliconlocal inference

來源 · 1 篇報導

首發 Hugging Face Blog huggingface.co 08:00