AURORA-LM:運用連續潛在擴散的統一編碼表示法
為何重要
這項研究代表 Diffusion Transformer 從視覺領域向文本生成領域的拓荒,挑戰了慣用的離散 Token 架構。雖然距離商業化尚遠,但證明瞭在不犧牲精度的前提下,擴散模型在語言建模上的潛力,且此模型程式碼實作於昇騰 NPU 上,反映了華為生態在推動新穎架構時的算力考量。
目前文本生成主要仍依賴離散 Token,與影像、音訊採用的連續潛在擴散呈現技術斷層;AURORA-LM 提出一種不犧牲 Token 精確度的連續潛在擴散架構,藉由分離高容量可解碼文本潛在表示的構建與其分佈的擬合來達成。
- 架構劃分:區分高容量無字首對齊潛在序列的編碼與分佈模仿,並保留全清潔潛在預測目標。
- 擴散機制:採用 Flow matching 方式運作,並藉由自我軌跡一致性銜接取樣範圍。
- 評測結果:在 OpenWebText 自由生成與 XSum 摘要任務上,表現優於其他連續潛在與擴散相關的語言模型。
- 產品規格:在約 1500 EFLOPs 的總運算量下,擴充套件至 10 億引數規模並超越特定公開發布的潛在擴散語言模型。