ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ExtractBench:用於企業檔案掃描提取的綜合評測集

研究 1 個來源 · 3 天前
為何重要

長文本表格處理與成本控制是企業 Agent 實際部署的關鍵痛點。ExtractBench 強化了「grounding」在評估中的重要地位,並明確指出目前主流 VLM 在處理長檔案時的缺陷。對產業而言,這顯示了開源 agentic stack(如 Llama 生態)在垂直企業用例上極致的成本效率優勢,可能重塑企業級自動化工具的選型邏輯。

企業 workflows 依賴 agents 進行 schema-guided extraction,需求正從單純準確轉為必須具備來源依據及成本可控。ExtractBench 提供了評估此類高難度任務的標準指向。

  • 資料集規模:共 4,869 頁來自 370 份企業檔案,涵蓋 8 個商業領域與 67 種檔案型別。
  • 評測維度:首次同時衡量 value accuracy、record completeness、grounding 以及 measured cost,包含 order-insensitive value F1 與 word/page-level grounding F1。
  • 效能對比:商業型 VLM 在長檔案上會截斷資料;coding agents 準確率高但成本較高;LlamaExtract Agentic Plus 在三項指標上穩居第一。
ExtractBenchLlamaExtractEnterprise AgentDocument ExtractionBenchmark

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00