ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

文檢模板令牌:擴散 Transformer (DiT) 內部隱含語義暫存器的研究

研究 1 個來源 · 15 天前
為何重要

本研究深入剖析了 Diffusion Transformers (DiTs) 內部如何重組資訊與維護物體身分,驗證了模型內部確實存在高效的語義路由與視覺合成分工,而非所有注意力頭都同等重要。對於開發者而言,這提供了具體的技術路徑來壓縮模型算力需求(20% FLOPs 下降),有助於推動更輕量級的生成式模型佈局;對產業界而言,這顯示出生成模型正從單純的能力競賽轉向可解釋性與效率最佳化的深水區。

Text-to-image diffusion transformers (DiTs) 透過處理文字與影像令牌生成影像,但其內部去噪機制較不為人知。研究團隊建立了一套因果可解釋性框架,分析模型的內部運作。研究發現,所謂「結構性模板令牌」充當了隱含的語義暫存器,不僅在全球注意力中表現為主要匯聚點,更間接維護了物體的身分(先將提示語義注入影像潛在空間再回讀)。基於此發現,研究團隊提出無需訓練的剪枝規則,剪枝後移除了 20% 的注意力浮點運算量,但 GenEval 效能僅下降 1.4 分。

Diffusion TransformersCausal InterpretabilityEfficient InferenceSemantic Routing

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00