ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

相同任務成本差異近 3,212 美元?解析決定推理帳單的五大關鍵要素

基建 1 個來源 · 5 天前
為何重要

對於開發者與產業來說,這篇文章打破了「選擇最佳模型就能節省成本」的迷思,強化了彈性算力基礎設施與 vLLM 等效能最佳化工具的重要性。這揭示了推理階段的成本複雜度遠高於訓練階段,特別是推理 Token 的計費機制(如高階推理模型),若未仔細計算,可能導致帳單膨脹 14.3 倍

RunInfra 針對全球 24 家供應商與 378 種 GPU 租金費率進行分析,發現即使是相同資料集與模型,每百萬個輸出 Token 的價格差異可達 $0.09$290.12 之間。作者指出,模型本身的技術差異僅佔少數,真正的成本支配力來自加速器選擇、供應商層級、佇列設定、運用率與推理 Token 等五大因素。

  • 具體價差案例gpt-oss-120b 在單顆 MI355X 上的價格為 $0.09/M output tokens,而 Qwen3.5 在八顆 H100 上的價格則高達 $290.12/M,兩者均源自同一週的公開費率表。
  • 硬體定價效率MI355XVultr 上售價為 $2.59/小時,低於市場任何一種 B200$5.89/小時,反映加速器市場定價效率低於模型市場。
  • 運用率門檻:自架模型存在結構性門檻,當需求低於硬體產能的 3 倍 時,增加流量並不會改善單位成本,必須升級硬體或轉向 API。
  • 隱藏計費陷阱:在 Kimi K3 上,同一組合因供應商不同可造成 $15 vs $3 的差價,且寫入 Cache 的成本可能是輸入 Rate 的 1.25x ~ 2.0x
RunInfraGPUCost OptimizationOn-PremiseQwen3.5

來源 · 1 篇報導

首發 Hacker News Front Page runinfra.ai 19:54