PaDoc:基於佈局的平行解碼檔案解析器
為何重要
PaDoc 填補了端到端解析器與多階段裁切解析器之間的缺口,在保留完整頁面上下文的前提下顯著提升了編碼效率。這對於需要精確處理公式、表格與修辭分割的學術或法律檔案場景具有重要意義,能大幅降低 OCR 後處理的落後時間。
傳統端到端檔案解析器因將頁面佈局與內容串流成一個序列而面臨解碼深度隨內容增加的效率問題。PaDoc 提出一種新架構,將預測佈局視為共享頁面表示上的分叉結構,並在同時進行頁面流與區域內容的並行推進。
- 在 OmniDocBench Full 基準上,總體 layout F1 達到 91.1,端到端解析器的整體 Score 為 94.24。
- 在 Text Edit 與 Formula CDM 等子專案中均有最佳表現,分別為 0.038 與 95.59。
- 在 384 頁測試集與單顆 A800 GPU 的設定下,較 Sequential SFT 基線提升 67.4-118% 的有效頁面吞吐量,並降低 39.2-54.9% 的 P95 延遲。
- 該技術透過打包可變長度祖先注意力與掩碼平行解碼於單一模態多語言大模型中實現。