Hetzner 推出 OpenAI 相容的 LLM 推理實驗服務
為何重要
Hetzner 藉著 OpenAI 相容的 API 格式極速切入推理市場,對於想測試小模型或多樣化權重的開發者來說,極具成本效益且部署門檻低。 值得注意的是,推理市場本質上是通用的「商品」,Hetzner 的核心競爭優勢在於其優異的硬體採購成本結構與歐洲資料中心佈局。如果這次實驗是未來匯入 B200/B300 等高階晶片或解決多卡通訊瓶頸的序章,那麼 Hetzner 將有能力從單純的虛擬化主機商,轉型為雲端算力的強勢競爭者。
德國主機託管商 Hetzner 正式推出實驗性質的 Hetzner Inference 服務,旨在測試市場對低當量的私有雲端 LLM 推理需求。
- 目前開放只使用一個模型:
Qwen/Qwen3.6-35B-A3B-FP8,這是一個 35 億總引數、3 億啟用動作引數的混合專家模型,透過 FP8 量化,支援影像輸入並擁有 262K 的上下文視窗。 - 服務尚未商業化,目前無收費、無服務等級協定(SLA)及生產環境保證,僅提供 OpenAI 相容的 API 介面。
- 效能實測資料顯示,在單一使用者阻塞連線下,短請求的中位數到首字時間為 153ms;在較長生成任務(上限 512 tokens)中,輸出速率達 224 tokens/s。