ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

視覺對比自蒸餾 (Visual Contrastive Self-Distillation, VCSD)

研究 1 個來源 · 13 天前
為何重要

VCSD 為多模態大模型提供了一種無需額外推理成本或外部資料來源的效能提升途徑,這對於預算有限或依賴邊緣硬體的開發者而言極具實用價值。它證明瞭透過精巧的對比學習機制,可以在不增加基礎設施營運壓力的情況下,顯著提升模型對視覺細節的捕捉能力,宣告了多模態模型持續最佳化的新方向。

現有的同策略自監督方法(OPSD)常依賴教師或外部視覺證據來建立不對稱性,本文提出 Visual Contrastive Self-Distillation (VCSD),移除這些依賴並利用影像內容移除生成監督訊號。

  • 在 ViRL39K 資料集測試中,VCSD 在 Qwen3-VL 和 Qwen3.5 模型上表現優於對等的 OPSD(7-benchmark aggregate)。
  • 具體資料:Qwen3-VL 於 2B/4B/8B 引數版本上,分別將 7-benchmark 整合分數由 62.27%、71.30% 與 72.51% 提升至 67.04%、73.16% 與 76.26%。
  • 機制運作:利用 EMA 教師在相同提示下,比較原始影像與內容擦除控制影像的 Token 機率差異,作為訓練訊號。
Visual Self-DistillationQwen3-VLViRL39KOn-Policy DistillationMulti-Modal LLM

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00