具指令碼感知 Sparse Mixture-of-Experts 的全語系場景文字辨識系統
為何重要
這項技術深刻挑戰了「單一模組處理萬國文字」在成本與精度間的權衡,突破單一有限資料的瓶頸。 對 OCR 產業而言,大幅超越 VLM 且引數量更少的表現,意味著未來企業在部署文字掃描或識別 API 時,能從昂貴的多模態模型轉向更精簡高效的專家混合架構。 開發者可利用此 ScriptMoE 架構快速提升 App 的多語支援能力,不再受困於單語系模型過載或通用模型精度不足的問題。
多語系場景文字辨識面臨資料稀缺與多字碼服務難題,現有方案非成本高昂即精度不足。本研究提出一種更精簡且精準的單一模組解決方案,透過合成資料集與獨特的混合專家架構來解決上述挑戰。
- 建構 TextMuSS-10M 資料集,涵蓋 10 種字型與 229 種語言,實現平衡監督。
- ScriptMoE 採用單一視覺編碼器搭配稀疏解碼區塊,路由機制僅將圖片傳送至前 2 個對應專家並由共用專家吸收跨語言知識。
- 在 TextMuSS-Bench (10 種字型,10,899 張圖片) 上達到 82.06% 準確率,優於最強基準線 1.31%。
- 將 PP-OCRv5 的識別器替換為該架構後,CC-OCR 任務 F1 分數由 65.71% 提升至 80.89%。