ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

在擴散語言模型中引入註冊 token 以支援受限狀態推理

研究 1 個來源 · 6 天前
為何重要

這項研究為擴散語言模型在長文本與程式碼生成等高門檻推理任務上,提供了原本受架構限制的解決方案。對開發者而言,這意味著擴散模型在處理複雜任務時的穩定性與邏輯能力有望迎來突破;對產業而言,若此架構能商業化,將大幅提升擴散模型在企業級市場的競爭力。

Masked diffusion language models (dLLMs) 傳統上難以在處理完一個 generation chunk 後清除上下文仍能維持推理。研究提出使用「註冊 token」作為專用固定位置 token,透過其連續 hidden states 搭建傳遞機制,使模型能在清除文本後憑藉內部狀態繼續進行邏輯推演。

  • 實作方式:透過後訓練,讓模型能解碼一個 chunk 並清除內容,同時保留註冊 token 的值作為狀態。
  • 效能表現:在 LLaDA 和 Dream 模型上,註冊 token 均優於離散文本攜帶方式,數學領域提升 8.5 分,程式碼提升 19.5 分。
  • 適用場景:特別有利於程式碼生成等邏輯範圍需跨越多個區塊的受限制任務。
  • 最佳化途徑:註冊 token 可透過 Reinforcement learning 在長期推理任務上進一步精煉。
diffusion language modelsdLLMsregister tokensreasoningLLaDADream

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00