NVIDIA 私有高效率生產環境 AI 推論的技術最佳化
為何重要
這次技術亮點證明「安全與效能」不再是單一優先順序的取捨,而是可以透過硬體架構(如 Blackwell + NVLink Encryption)與軟體堆疊的協同最佳化來兼顧。對於企業與開發者而言,這代表原先擔心的隱私開銷已降至可接受範圍,讓原本受限於資安政策的機密模型(如 DeepSeek-R1)得以順利部署於企業私有雲,從理論轉向實際商業營運。
隨著 LLM 逐步應用於涉及敏感資料與專屬模型的監管環境,資料必須在可信賴的硬體中處理。NVIDIA 此篇技術文探討如何在不犧牲效能的前提下,透過 Confidential Computing (CC) 確保生產級 AI 推論的安全執行。
- TensorRT LLM 針對 CC 環境調整主機至裝置傳輸邏輯,改用頁面式記憶體與非同步 Worker 取消鎖定,並採用 GPU %globaltimer 來重建核心自動調優器的時序。
- 在受保護的 8 顆 NVIDIA B200 GPU 環境中執行 Confidential DeepSeek-R1 模型,仍可保留 96.1% 至 98.2% 的 CC-off 環境吞吐量,且每 Token 延遲代價低於 5%。