ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Functionalizer:用於子詞分詞無損功能性分解的新模型

研究 1 個來源 · 23 小時前
為何重要

此研究在 tokenization 層面證明瞭「結構性保留」是最佳化模型效率的關鍵之一。透過類似程式語言的操作碼設計,模型既能維持較小的詞典規模以降低運算成本,又能精確捕捉重要性高的結構資訊(如程式邏輯符號或語音標註)。這意味著在不增加引數量的前提下,社群有新的手段來提升程式碼生成與多語言生成模型的品質。

傳統子詞分詞器常因將字詞變體視為無關詞彙而導致嵌入空間破碎,或是透過有損標準化丟棄差異性。Functionalizer 提出一個無損的前置分詞框架,將拼寫和結構變異分解為包含可逆運算碼(如 CAPiTallize、變音符號運運算元)組合的「運算碼/運算元」字首流。

  • 該技術在未受限條件下將實際詞典槽位需求減少最高達 19.7%,同時維持完整的語料覆蓋率。
  • 在 98M 引數的 GPT-2 模型上驗證,該方法將 Python 程式碼語法有效性提升至 9.12%(對比 7.70%),並有效減少自然語言中的重複 n-gram。
FunctionalizertokenizerGPT-2Unicode Private Use Area無失真壓縮結構化語言模型

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00