文件檢索感知分塊:透過 PDF 歸一化與多模態 Markdown 轉換實現企業文件的通用檢索感知匯入
為何重要
D-RAC 觸及 RAG 架構中最關鍵卻最易被忽視的資料 ingestion 清洗環節,透過結構化的 Markdown 轉換大幅降低了 Token 成本並確保資訊還原的可靠性。對於企業級 RAG 解決方案而言,不僅技術路徑具體可行,更是最佳化營運成本與提升檢索精準度的關鍵最佳化點。
RAG 系統在處理以 PDF、Word 等為主的企業知識庫時,常受困於複雜視覺排版與多欄位設計,傳統基規則提取與 OCR 易破壞結構或產生幻覺。本文提出 Document Retrieval-Aware Chunking (D-RAC),將任意格式檔案歸一化為 PDF 並透過單次多模態 LLM 呼叫轉換為最佳化檢索的 Markdown,繼而進行低成本分塊。