Netlify 揭示多模型效能與成本差異:一個提示詞對比 11 種結果
為何重要
Netlify 的實測資料揭露了 Claude Opus 底層模型執行成本嚴重的方差問題(單次耗資高達平均值的 7 倍),這對於需要穩定性與預算控制的 SaaS 生產環境是個關鍵警示。當前 AI Infra 廠商若無法提供清晰的效能/成本優勢對比指南,開發者將難以在大廠與開源模型間做出權衡,此類開源評測有助於建立行業標準。
Netlify 與 OpenRouter 合作推出 AI Gateway & Agent Runners,讓開發者在單一平臺上對比 11 種前沿模型(包含 Kimi K3、GLM 5.2、DeepSeek V4 等)的效能與成本消耗,並公開內部開源工具 AXIS 的評測邏輯以縮減功能失誤風險。
- 透過 AI Gateway 提供多模型選擇,II 並在 Agent Runners 中整合 GLM 5.2、DeepSeek V4 等開源模型。
- 內部使用開源工具 AXIS 進行功能正確性評估,若模型失敗率高或成本過高則不再對外提供使用。
- 實測咖啡店網站案例顯示,Claude Opus 的執行費用力差極大,單次高達 1055 credits(約為同組平均值的 7 倍)。