不降精度本地滿血執行 RunningHub 打造 MiniMax H3 Lightning 加速方案
為何重要
這不僅是一項工程最佳化成果,更是海馬雲將長年壓榨 GPU 效能與容器排程技術轉化至 AI 推理領域的具體案例,顯示出傳統雲算力基礎設施商轉型 AI 落地服務的可行性。對於開發者與創作者而言,這類工具將影片模型的「成本門檻」與「時間門檻」大幅降低,讓非頂級資料中心的團隊也能實現專業級的生產力,進一步推動 AIGC 在垂直領域的普及。
RunningHub 宣佈專為 MiniMax H3 模型打造的本地部署加速方案,在不降低 BF16 精度的前提下,將影片生成速度提升了約 12 倍。
- 在 4 張 RTX 6000D 環境下,生成 5 秒 1344×768 影片的時間從原始方案的 348.8 秒縮短至 28.7 秒,生成耗時減少約 92%。
- 技術上整合 RH 後訓練加速模型、SageAttention2、Cache-DiT 以及 TP2+Ulysses4 多卡並行策略,以降低 PCIe 環境下的通訊成本。
- 該加速套件已在 GitHub 開源,基於海馬雲多年在 GPU 容器排程與雲渲染領域的技術積累,專為工作室和中小團隊的本地部署情境最佳化。