Chimera:具原則性擴放的混合視覺擴散模型
為何重要
Chimera 結合稀疏 MoE 與混合注意力機制,具體印證了 Chinchilla scaling laws 在長上下文視覺生成中的有效性,效率較全注意力架構提升 7.3 倍。這不僅為 OpenAI、Google 等大廠的模型訓練策略提供了新範本,也減少了後續高解析度影像生成對算力的極端渴求,對雲端 AI 營運成本的最佳化具有指標意義。
- 面對視覺生成技術對高解析度影像與長影片的需求,全注意力機制的二次方計算成本構成了主要障礙。
- Chimera 採用 Kimi Delta Attention 與多頭潛在注意力機制,在無位置編碼的情況下處理長上下文並維持 O(N) 複雜度。
- 機構引入稀疏 MoE 層與 HeteroP 模組切換超引數 scheme,訓練出含 11B 引數總量、僅 2B 啟用引數的架構。
- 指標上,其密集架構達到 Wan-2.1 2B 基準的 1.7 倍效率,完整系統更達 7.3 倍。
- 模型具備零樣本遷移能力,可從 5 秒訓練片段推演 30 秒影片,末端失真僅 6.5%。