螞蟻百靈釋出新一代原生混合推理模型Ling-3.0-Flash
為何重要
Ling-3.0-Flash 的 1/64 引數啟用比與長上下文最佳化,凸顯了混合推理架構在降低推理成本與提升延遲回應上的實質潛力,將重塑開發者在 Edge Device 或資料庫受限環境下的部署策略,進而影響雲端 AI 服務供應鏈的成本競爭力。
7月24日,螞蟻百靈正式公佈新一代原生混合推理模型 Ling-3.0-Flash,透過最佳化注意力機構架構,實現了小型引數體積下的高推理效益與 Agent 應用落地。
- 模型總引數量為 124B,單次計算僅啟用 5.1B 引數,並在核心指標上對標甚至超越引數量為其 2 至 3 倍的領先模型。
- 技術上棄用堆砌引數策略,採用 KDA 線性注意力層與 MLA 層混合架構(5:1 比例),並將每次計算的專家啟用比例壓縮至前代的 1/64。
- 模型已上架 OpenRouter 提供一週免費體驗,隨後將正式開源;透過叢集級分級快取技術,長輸入下的首字回應延遲降低了 60% 至 80%。