ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

在 AI 工作負載上線前,NVIDIA 推出開源控制器驗證 GPU 叢集

基建 1 個來源 · 1 小時前
為何重要

隨著 GPU 叢集規模擴大至千顆等級,微小的硬體效能或網路拓樸誤差常導致生產環境不可預期的訓練失敗。NVCRE 將原本依賴手冊與個別管理的繁瑣排錯流程,轉化為可程式化、標準化的 Kubernetes 原生工作流,大幅降低雲端服務商與企業使用者對於 GPU 叢集佈署的技術門檻,確保 AI 應用能穩定上線。

透過在生產託管前執行真實的分散式工作負載,NVIDIA 引入了 Cluster Readiness Engine (NVCRE),來標準化 GPU 叢集的可靠性驗證流程。

  • 層級式故障歸因:利用認證(Certification)、工作流(Workflow)與作業(Job)的層級 API 來測試 NCCL 通訊、NeMo 預訓練(8B/56B 引數)及 DCGM 健康檢查,並將失敗具體定位到特定節點。
  • 自適應故障隔離:針對全規模測試中難以定位的集體渲染故障,自動分割執行緒並重測,直到縮小出有嫌疑的節點範圍。
  • OS 層概念整合:將 NVCRE 整合 NVIDIA AI Cluster Runtime 與 NVSentinel,構成名為 NVIDIA DSX OS 的作業系統層,方便開發者透過 nvcrectl setup init 指令初始化。
NVIDIANVCREKubernetesGPU Cluster

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 03:45