ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

AURORA-LM:運用連續潛在擴散的統一編碼表示法

研究 1 個來源 · 1 天前
為何重要

這項研究代表 Diffusion Transformer 從視覺領域向文本生成領域的拓荒,挑戰了慣用的離散 Token 架構。雖然距離商業化尚遠,但證明瞭在不犧牲精度的前提下,擴散模型在語言建模上的潛力,且此模型程式碼實作於昇騰 NPU 上,反映了華為生態在推動新穎架構時的算力考量。

目前文本生成主要仍依賴離散 Token,與影像、音訊採用的連續潛在擴散呈現技術斷層;AURORA-LM 提出一種不犧牲 Token 精確度的連續潛在擴散架構,藉由分離高容量可解碼文本潛在表示的構建與其分佈的擬合來達成。

  • 架構劃分:區分高容量無字首對齊潛在序列的編碼與分佈模仿,並保留全清潔潛在預測目標。
  • 擴散機制:採用 Flow matching 方式運作,並藉由自我軌跡一致性銜接取樣範圍。
  • 評測結果:在 OpenWebText 自由生成與 XSum 摘要任務上,表現優於其他連續潛在與擴散相關的語言模型。
  • 產品規格:在約 1500 EFLOPs 的總運算量下,擴充套件至 10 億引數規模並超越特定公開發布的潛在擴散語言模型。
AURORA-LMContinuous-Latent DiffusionDiffusion TransformerAscend NPULanguage ModelHuggingFace

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00