全球首個 Agentic 擴散模型 LLaDA 2.2:128K 上下文並行生成,吞吐量達自迴歸模型的 1.64 倍
為何重要
這一突破打破了業界長期認定的「Agent 只能由自迴歸模型驅動」的定見,證實擴散架構透過長上下文與動態編輯技術已能與自迴歸並駕齊驅。對開發者而言,這暗示未來可能出現「專分工廠與端側的高吞吐量擴散節點」以及「負責嚴格邏輯推理的自迴歸節點」並存的 Hybrid 架構,能顯著降低部署於時間敏感場景的成本。
inclusionAI 發布的 LLaDA 2.2 是全球首個大規模 Agentic 擴散模型,打破了自迴歸模型在智慧體領域的壟斷,證明擴散架構結合 MoE 後具備工程部署與競爭價值。
- 原生支援 128K 上下文,並透過「BlockRouting」機制精準控管總活躍專家數,有效降低 HBM 流量與通訊成本。
- 整合 Levenshtein 編輯與 L-EBPO 策略,實現邊生成邊動態修正(刪除/插入/替換)錯誤,在 SWE-bench Verified 上精確提升 8.6 個百分點。
- 在 11 種工作負載下,BF16 吞吐量達頂尖自迴歸模型 Ling-2.6-flash 的 1.64 倍,量化至 FP8 時可額外提升 18.6%。
- 對齊七項 Agent 基準測試,平均分 53.83(vs Ling-2.6-flash 的 55.74),在 τ²-Bench 等三項互動式任務上實現反超。