ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

NVIDIA FLARE 支援跨 Docker、Kubernetes 與 Slurm 的聯邦學習擴充套件

基建 1 個來源 · 7 天前
為何重要

長期以來,聯邦學習在與多重、異質化的基礎設施協作時常面臨運維複雜的阻礙,此技術突破使其更容易從實驗工具轉變為生產級的跨組織平臺。 對於 HPC 基礎設施與 GPU 管理者而言,這代表 NVIDIA FLARE 能無縫整合既有的 Slurm 資源分配模型,提升 GPU 在研究與企業協作場景中的實用性。 值得關注企業級應用(如醫療或金融)如何利用具備多租戶隔離功能的 FLARE 來降低跨域資料共享的合規成本與技術門檻。

NVIDIA FLARE 透過分離持久化聯邦服務與動態工作職務的兩層架構,解決了跨不同基礎設施(如 Docker 主機、Kubernetes 叢集或 Slurm 叢集)執行聯邦學習的難題,讓各節點可依本地環境靈活配置資源與排程。

  • FLARE 2.8 提供 Docker 與 Kubernetes 部署支援,而 FLARE 2.9 則進一步新增 Slurm 支援,使其能處理 HPC 與共享 GPU 叢集的排程需求。
  • 系統將聯邦協調與任務執行解耦,父程式保持可用而不佔用 GPU,工作職務則按需請求 GPU、CPU 與記憶體資源。
  • 透過邏輯多租戶邊界與 local/study_runtime.yaml 設定,各研究團隊可獨立管理敏感資訊、認可的映像檔及符合本地安全策略的工作負載。
NVIDIA FLAREFederated LearningKubernetesSlurmHPCOperational AI

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 23:00