ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

NVIDIA 在 GB300 NVL72 上支援 Alibaba Qwen3.8-Flash-Next 176B 模型進行長上下文代理編碼

模型 1 個來源 · 27 天前
為何重要

這篇技術帖揭示長上下文訓練與推論架構正從純 Attention 轉向混合 DeltaNet/稀疏 Attention 模式,這類架構能顯著降低 KV Cache 的 Memory 飽和問題,是未來 Agentic Workflow 的關鍵路徑。對 NVIDIA 而言,透過 Day-0 支援 Alibaba 如此高引數叢集模型,有助於鞏固 GB300 在超大型 LLM 部署上的標竿地位,驗證其 NVLink 基礎設施在處理複雜 MoE 網路效應時的實用性。

Alibaba 發布 Qwen3.8-Flash-Next 模型作為具備長上下文能力的探索之作(Qwen4 預覽版),並由 NVIDIA 在其頂級 GB300 NVL72 硬體上展示推論效能,解決長序列下的計算瓶頸。

  • 模型採用混合 Gated DeltaNet (GDN) 與 Qwen Sparse Attention (QSA) 架構,在 1M tokens 上下文與最佳化設定下,相較 Qwen3.7-Plus 實現 8.6x 預填充吞吐量增益。
  • 在 NVIDIA GB300 NVL72 硬體上(72 顆 Blackwell Ultra GPU),該模型達到每 GPU 16K tokens/sec 的吞吐量與每使用者約 200 tokens/sec 的速度。
  • NVIDIA 提供 Day-0 支援生態,涵蓋 vLLM、TensorRT LLM 與 NeMo AutoModel 微調工具,並支援從 DGX Spark 到 GB300 NVL72 的規模部署。
AlibabaQwen3.8NVIDIA GB300MoELong ContextAgentic Coding

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 01:07