從覆蓋範圍到能力的強健端到端檔案解析新框架:WeVisDoc
為何重要
這項研究揭示了「涵蓋度不足」是檔案解析的主要瓶頸,並驗證了針對殘餘錯誤進行精準資料最佳化有效。對於開發者而言,這意味著在構建 RAG(檢索增強生成)系統或自動化文件處理引擎時,可改用此類資料導向策略來提升弱場景的識別率,進而降低企業投入智慧應用的門檻與成本。
- 研究背景:現有檔案解析模型訓練資料多傾向於常見型別與高品質數位頁面,導致在複雜場景下泛化能力不足;WeVisDoc 提出一個以資料為中心(Data-centric)的兩階段框架,從單純擴充資料覆蓋範圍提升至精準診斷與修正殘餘錯誤。
- 技術實作:Stage I 透過異質資料與透過結構保持的降解合成來拓寬視覺模型的語意與結構覆蓋範圍;Stage II 則利用保留的探針測量固定視覺結構叢集中的殘餘錯誤,並引導目標令牌預算的精準重分配。
- 量化基準表現:WeVisDoc-4B 在 OmniDocBench v1.6 上取得 95.38 的整體分數,在三個 PureDocBench 軌道上的平均整體分數為 75.54,且在所有四種設定中均排名第一。
- 效能最佳化結果:相較於 Stage I,Stage II 帶來顯著表現增長,特別是在「Real Degraded」軌道上,WeVisDoc-4B 的整體分數提升了 4.03 點。