讓 Token 生產更高效:異構混推的技術進化與實踐
為何重要
在推理成本驅動的「Token 經濟」下,傳統僅依賴算力堆疊的基礎設施已無法滿足增值需求,商湯的技術演進顯示出資源排程邏輯正從「物理分配」轉向「效能排程」。 該架構打破了專有晶片的標籤化限制(如僅為 P 或 D 節點),透過軟體定義邏輯提升硬體利用率,這是後續 AI 產業在晶片碎片化基礎上商業化落地的關鍵路徑。 對於開發者而言,這意味著異構混推的門檻降低,平臺級動態池化工具將成為構建高效推理服務的核心依賴,影響 API 價格與服務延遲的穩定性。
隨著 Token 經濟爆發,推理需求已成為算力增長主引擎,商湯大裝置在「Token 工廠」架構下,提出以 Token 為中心的系統設計以解決 Agent 時代長上下文與高併發的統一挑戰。
- 商湯大裝置將底層設計從「算力中心」轉向「Token、狀態與時延預算中心」,致力於提升 Token 產出效率與單位成本。
- 平臺日均 Token 服務量從今年 2 月的 0.46 萬億,激增至 8 月的 4.5 萬億。
- 技術層面採用「橫向串聯資源」與「縱向模型×引擎×晶片」最佳化,並不固定 P 節點或 D 節點,而是根據負載動態調整角色分工。
- 為應對高延遲與 MoE 模型需求,系統架構正從固定 P/D 配比升級為動態 Prefill Pool 與 Decode Pool,未來甚至規劃細分為 Encoder、Attention 等模組級資源池。