ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ModelExpress:達到光速的模型權重分發技術

基建 1 個來源 · 12 天前
為何重要

ModelExpress 代表 NVIDIA 將其控制力從純推理硬體延伸至資料運輸軟體層,透過減少「資料搬運」的時間來提升 GPU 資源利用率。對於自建 LLM 的部署者而言,這直接縮短了上下線與擴充套件的 SLA 導程,進而影響企業採購新 GPU 的週期;對於 NVIDIA,這鞏固了以 CUDA 為核心的閉環生態優勢。

NVIDIA 釋出 ModelExpress (MX) 平臺,專為消除大型模型在叢集間載入時的瓶頸而設計,透過智慧路徑選擇將載入時間壓縮至秒級。

  • 將 DeepSeek-V4 Pro 模型的權重傳輸時間縮短至 10 秒以內,帳號整體啟動時間從 8 分鐘減少至 1 分 44 秒。
  • 最佳化冷啟動流程,支援從物件儲存(如 S3、HF)串流至 GPU 而無需經過硬碟,並透過 GPU-to-GPU P2P RDMA 直接傳輸跳過主機記憶體。
  • 整合 vLLM、SGLang、Dynamo 等框架,並使用 NIXL 傳輸引擎與 GPUDirect Storage 技術來處理分散式快取與 RL 重訓工作流程。
NVIDIAModelExpressLLM DeploymentGenerative AIDeepSeek-V4 Pro

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 00:45