ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Chimera:具原則性擴放的混合視覺擴散模型

研究 1 個來源 · 6 天前
為何重要

Chimera 結合稀疏 MoE 與混合注意力機制,具體印證了 Chinchilla scaling laws 在長上下文視覺生成中的有效性,效率較全注意力架構提升 7.3 倍。這不僅為 OpenAI、Google 等大廠的模型訓練策略提供了新範本,也減少了後續高解析度影像生成對算力的極端渴求,對雲端 AI 營運成本的最佳化具有指標意義。

  • 面對視覺生成技術對高解析度影像與長影片的需求,全注意力機制的二次方計算成本構成了主要障礙。
  • Chimera 採用 Kimi Delta Attention 與多頭潛在注意力機制,在無位置編碼的情況下處理長上下文並維持 O(N) 複雜度。
  • 機構引入稀疏 MoE 層與 HeteroP 模組切換超引數 scheme,訓練出含 11B 引數總量、僅 2B 啟用引數的架構。
  • 指標上,其密集架構達到 Wan-2.1 2B 基準的 1.7 倍效率,完整系統更達 7.3 倍。
  • 模型具備零樣本遷移能力,可從 5 秒訓練片段推演 30 秒影片,末端失真僅 6.5%。
ChimeraVisual Diffusion TransformerMoEKimi Delta Attentioncomputational efficiencylong-context video

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00