ExtractBench:用於企業檔案掃描提取的綜合評測集
為何重要
長文本表格處理與成本控制是企業 Agent 實際部署的關鍵痛點。ExtractBench 強化了「grounding」在評估中的重要地位,並明確指出目前主流 VLM 在處理長檔案時的缺陷。對產業而言,這顯示了開源 agentic stack(如 Llama 生態)在垂直企業用例上極致的成本效率優勢,可能重塑企業級自動化工具的選型邏輯。
企業 workflows 依賴 agents 進行 schema-guided extraction,需求正從單純準確轉為必須具備來源依據及成本可控。ExtractBench 提供了評估此類高難度任務的標準指向。
- 資料集規模:共 4,869 頁來自 370 份企業檔案,涵蓋 8 個商業領域與 67 種檔案型別。
- 評測維度:首次同時衡量 value accuracy、record completeness、grounding 以及 measured cost,包含 order-insensitive value F1 與 word/page-level grounding F1。
- 效能對比:商業型 VLM 在長檔案上會截斷資料;coding agents 準確率高但成本較高;LlamaExtract Agentic Plus 在三項指標上穩居第一。