ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

隱約計時器:擴散語言模型中的潛在時間建模

研究 1 個來源 · 14 天前
為何重要

此發現證實 DLMs 雖未顯式依賴時間步資訊,卻具備監控去噪進度的內在機制,讓開發者對模型內部運作有了直觀的理解。 對於未來的模型架構設計,若能有效駕馭這類潛在時間訊號,可能有助於提升長文本或多步驟推理任務的生成穩定性。 目前這項發現主要影響研究與開發層面,雖非直接商業化衝擊,但為提升模型可控性開啟了新的技術視角。

擴散語言模型(DLMs)作為自迴歸模型的潛在替代方案,目前受矚目。本文探討 DLMs 是否能內部表示去噪進度,並發現盡管大多數擴散方法會顯式地條件化時間步,DLMs 仍具備此能力。

  • 研究顯示 DLMs 在殘差流中確實編碼了與擴散時間步相關的潛在表示。
  • 利用探測器可跨層可靠地提取此訊號,證明去噪進度可從內部活化中解碼。
  • 對模型沿著與時間步關聯的低維子空間進行引導,能系統性地調整其去噪進度的概念,進而預期改變模型自信度與熵值。
Diffusion Language ModelsLatent Time ModellingInterpretabilityResidual Streams

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00