ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Meta 與華盛頓大學:以 Byte-Based Distillation 突破 Token 訓練天花板

研究 1 個來源 · 8 天前
為何重要

這項研究成果挑戰了長期被視為基礎假設的 Token 邏輯,證明基於 Byte 的訓練路徑可釋放小型模型被低估的 Scaling 能力。 對開發者而言,這提供了一條在邊緣裝置或受限運算環境中部署具備高階能力模型的技術路徑;對產業而言,這意味著能以更低的算力與儲存成本解決 Edge AI 與終端部署的痛點。

Meta 與華盛頓大學團隊提出一種將訓練學習單位從傳統 Token 轉換為 Byte 的新方法,旨在突破小型模型的效能上界。

  • 效能上限提升:在以 Llama 3-8B 為教師的實驗中,採用 End-Of-Token 策略的字級 Distillation,預測平均準確率上限為 52.4%,比傳統 Token 蒸餾高出 4 個百分點。
  • 算力與儲存效能:Byte 模型透過總引數量僅 12.8 億(低於 Token 模型的 18.1 億)實現更佳的 Scaling 潛力,在相似計算預算下可處理約 6 倍的文本量,儲存壓力也能降低至約五分之一。
  • 轉換機制:研究提出 Marginalize-It 和 End-Of-Token 兩種方案,將教師模型的 Token 機率分佈完整對映至 Byte 級別,讓學生模型在更小的預測空間中學習。
MetaByte-Based DistillationLlama 3Scaling LawsEnd-Of-Token

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 14:37