ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

合成資料對泰文 OCR 達到的極限

研究 1 個來源 · 9 天前
為何重要

這不僅解決了泰文等低資源語言的 OCR 應用瓶頸,更透過釐清「合成資料轉移效應」的變因(如字型多樣性與手寫字形),為開發者提供了一套不用依賴真實標註即可建立高精度視覺模型的可行路徑。這對於資料成本敏感的產業具有重要示範意義。

該研究透過受控的檔案重建流水線,解析合成監督轉移至真實泰文檔案的關鍵因素,進而透過 45,723 頁合成資料訓練出 *Wayu-Paxa-OCR-Zero* 模型。

  • 模型訓練:使用 0.9B 引數的 *PaddleOCR-VL-1.6* 基礎檢查點,加入 45,723 頁合成頁面進行微調。
  • 效能資料:距離基礎檢查點,行間 OCR 的真實列印字元錯誤率(CER)從 6.64% 降至 1.24%,手寫字 CER 則從 74.87% 大幅降至 20.55%。
  • 競爭力:該模型在所有五個評估集上都優於 *Typhoon OCR v1 7B*,印證合成資料可用於訓練競爭力強的 OCR 模型。
  • 技術洞察:訓練粒度關乎效能,例如領域內重建在頁面級訓練時接近真實監督(1.82% vs 1.31% CER),但在裁剪級訓練則變差(15.59% vs 5.52% CER)。
Thai OCRWayu-Paxa-OCR-ZeroSynthetic DataPaddleOCR-VL-1.6Typhoon OCRNo-Label Training

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00