HPD-Parsing:架構式並行檔案解析
為何重要
這項研究針對 LLM 處理結構化生成任務(如檔案解析)長期存在的效率與準確度難題提供新解。此架構若能轉化為 SDK 或基礎模組,將直接影響 B2B 檔案處理 API 的成本結構與延遲 performance,是提升 agent 工具生產力的重要技術路徑。
現有統一視覺語言模型(VLM)在解析檔案時,因採用貫穿整頁的自迴歸生成方式,易導致處理長檔案時的序列瓶頸。研究者介紹 HPD-Parsing 架構,提出「架構式並行解碼」取代傳統全頁自迴歸,以解決此效率問題。
- 探索將主佈局分支與 P-MTP 技術結合,動態分配區塊給並發分支。
- 根據公 benchmark 測試,吞吐量達每秒 4,752 tokens。
- 分別比最快現有模型與基線模型快 2.62 倍與 3.06 倍,並維持競爭性的解析準確度。