ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

StableVQ:向量量化 Tokenizer 訓練的實用穩定性指南

研究 1 個來源 · 9 小時前
為何重要

視覺 Tokenizer 的穩定性直接影響影像生成模型的 Token 取捨與推理成本。StableVQ 提供了一組具體且不含額外引數(NDP)的技術修復方案,能讓開發者在迭代生成模型時降低訓練失敗率。這對於需要高維度 Tokenizer 來捕捉細節的生物識別或高保真合成應用具有重要變革意義。

現代自迴歸和 masked image generation 模型依賴向量量化以處理視覺 Token,但訓練穩定性仍是瓶頸。

  • StableVQ 提出解耦 Encoder-Decoder 與 Codebook 的學習目標與最佳化節奏,解決主系統依賴脆弱的「偶然協作」問題。
  • 核心技術包含 Dynamic STE(修復 Encoder 學習目標)、Region VQ Loss(重構 Codebook 以追蹤分佈)及 Decoupled Schedule(獨立學習率排程)。
  • 該方法建構於共享投影程式碼本上,為輕量級且無新增引數,在 ImageNet 上的測試顯示訓練穩定性、程式碼本利用率與重建品質皆獲得提升。
StableVQVector QuantizationImageNetVQComputer Vision

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00