PDF 字元辨識:OCR 如何運作及在哪些情況下失效
OCR 透過辨識掃描 PDF 中的像素字形,將影像文字轉成可搜尋、可選取的機器可讀文字。輸出可保留掃描影像並加入隱藏文字層,亦可用可編輯文字取代掃描影像。遇上多欄排版,閲讀次序可能被打亂;表格亦可能攤平成無結構文字,令辨識結果難以供機器使用。
OCR 透過辨識掃描 PDF 中的像素字形,將影像文字轉成可搜尋、可選取的機器可讀文字。輸出可保留掃描影像並加入隱藏文字層,亦可用可編輯文字取代掃描影像。遇上多欄排版,閲讀次序可能被打亂;表格亦可能攤平成無結構文字,令辨識結果難以供機器使用。
可靠的金融文件欄位擷取範本不能只列欄位,還須定義資料型別、結構、預期位置及驗證規則,以免系統因版面差異而靜默輸出錯誤數值。發票與銀行結單應採用分開的模組化結構並共用驗證層;OCR 之外,處理層亦須理解文件版面,否則規則式定位及逐頁擷取可能造成錯值、交易列遺漏或重複。
LiteParse 以網格投影演算法將 PDF 文字座標重建為純文字,利用等寬字元網格保留空間排列與對齊結構。演算法按 Y 座標容差將文字片段分行,並抽取左、右及置中錨點,將內容吸附至相應位置。空白壓縮可把 4 個空格的欄距縮為 2 個,以保留 LLM tokens 並維持版面資訊;GridDebugLogger 則可追蹤處理流程中的判斷。
LlamaIndex 與 Kaggle 推出 ParseBench 文件 OCR 排行榜,讓從業者比較解析器、視覺語言模型和文件智能體在企業文件抽取任務上的表現。
這套按揭收入核驗流程以 LlamaParse Extract 從貸款申請、W-2、糧單及銀行月結單抽取結構化資料,再由 Claude 交叉核驗並生成自包含 HTML 報告。
LlamaIndex 重構 LlamaParse Platform MCP,將重心由儲存與檢索轉向由 Parse、Classify 和 Split 服務支援的文件處理。
LlamaIndex 推出 LiteParse Server,將 LiteParse 封裝為可自託管的 HTTP API,供不同語言或服務作為文件解析後端。它支援 PDF、Office 文件和圖片,提供帶有文字位置與邊界框的解析結果,並設有 /parse 和 /screenshots 兩個端點。
這個示範應用以 LiteParse 建立財務盡職調查 AI 智能體,可匯入 SEC 申報文件、跨文件搜尋並回答問題,並在原始 PDF 頁面高亮精確引用位置。
護照的 MRZ 不只是兩行待辨識文字,而是依 ICAO Document 9303 編碼、附有校驗碼的身份紀錄;TD3 格式每行 44 個字符,欄位校驗碼按 7-3-1 權重計算並取 modulo 10。只抽取字符而不驗證校驗碼,或不比對 VIZ 與 MRZ,便可能漏掉辨識錯誤及篡改差異。交叉驗證亦可在 VIZ 遭全息圖眩光遮擋時參照 MRZ 資料,並標記差異供審核。
貸款文件自動化的成敗取決於擷取與文件分類的準確度;只自動化流程轉送、沿用傳統 OCR,仍無法消除人工核對。採用 AI 決策但仍以舊式 OCR 擷取的貸款機構,仍須人工審查 40-60% 的檔案。Agentic OCR 會按頁面與元素類型識別文件、選擇模型並驗證擷取值,簡化後續收入計算、條件追蹤及承保審查。
保險理賠文件的 OCR 處理須超越文字辨識,重建結構化資料並保存欄位關聯,以支援理賠處理。系統結合機器學習、電腦視覺與版面感知解析,再按業務規則、保單保障及佐證文件驗證擷取值。信心評分用於判斷資料可否自動處理或須人工覆核;驗證後的資料可整合至理賠系統,支援自動決策、合規報告與分析工作流程。
Logan(LlamaIndex 的 Head of OSS)在 NYC 工作坊帶領開發者用 LlamaParse 建立貸款審核流程,處理薪資單與券商結單 PDF,抽取結構化資料並進行跨文件分析。
LlamaIndex 發佈 LiteParse v2.0,提供 Rust、Node、Python 和 WASM 套件,可在瀏覽器及 edge runtimes 執行。
Adobe Acrobat 的 Scan & OCR 可用四次點擊為掃描 PDF 建立文字層,讓單份文件可用 Ctrl+F 搜尋,但不保證大量檔案檢索準確。單份低敏感文件可用免費線上 OCR,機密批次掃描則可用本機 OCRmyPDF;Google Drive 會把文字轉成新 Doc,而非可搜尋 PDF。
LlamaIndex 宣佈 LlamaParse 推出精細邊界框功能,可按行、字詞及表格儲存格標示文件位置。只有頁面上明確存在的文字會獲分配座標,推斷值、AI 摘要及重建內容則不會有邊界框。功能現以 beta 形式向所有付費方案提供,建立解析任務時須以單一參數選擇啟用;Agentic Plus 會額外執行驗證輪次以提升精度。
LlamaIndex 推出 LiteParse v2.1,新增以啟發式規則實現的無模型 PDF 轉 Markdown 管線。文章稱它在 3 項基準中領先同類無模型開源工具;文首列出的分數為 opendataloader-bench 0.875、olmOCR-bench 0.391、ParseBench 0.3279,後文表格則分別列出 0.871、39.2% 和 0.328。
LlamaIndex 擴展 LlamaParse MCP,加入 Extract 服務整合、Index v2 的智能體知識存取,以及按產品劃分的專用 MCP 端點。
LlamaIndex 在 LlamaParse Index 中加入 Retrieval Harness,並將該功能及其他更新以 Beta 形式開放予所有付費方案。
LlamaIndex 在 7-15-26 電子報公佈多項產品更新,涵蓋抽取、Markdown 輸出、表格處理和方案席位。Conversational Extract 可透過對話建立抽取 schema,fast tier 預設輸出 Markdown,Agentic Plus 的表格處理有所改善,所有方案(包括免費方案)均支援 100 位使用者。
貸款處理指南示範以 LlamaParse 建立自動化文件擷取流程,涵蓋由申請到批核的多類貸款文件。流程按文件特性選用 Cost-Effective、Balanced、Premium 或 Agentic 模式,並透過跨文件核驗檢查税表收入、銀行存款、借款實體及估值等資料的一致性。
LlamaIndex 的 Parse Gateway 按頁面複雜度將文件分流至 LiteParse 或相應的 LlamaParse 層級,而非整份文件使用同一解析器。
LLM OCR 降低了難讀文件的錯誤率,但漏讀或錯認可能藏在流暢、格式整齊的結果中,令錯誤更難察覺。文章區分 OCR 後校正、VLM 原生轉錄與智能體編排,並指出欄位級準確度、來源定位和驗證流程可補足頁面級字串相似度的不足。
智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。
Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。
LlamaIndex 梳理 OCR 從基本文字擷取到生產級文件處理管線的落差,並説明 LlamaParse 如何按文件元素調用專用模型,經修正迴圈驗證後輸出 Markdown 或 JSON。
Google 開源 Credentio C++ 庫,用於驗證 C2PA Content Credentials,起步支援規格版本 2.2 和 2.4。其 API 可在開發者應用程式本地執行驗證,媒體檔案毋須傳送至雲端或外部驗證端點;驗證大型檔案時,Credentio 使用的記憶體亦少於其他方案。
LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。
Google 介紹如何以 Agent Development Kit(ADK)構建零信任 AI 智能體,並以 Gemini 驅動的客服退款智能體作示範。文章提出三層防護,分別以硬件支援的簽名、gVisor 沙箱及確定性語義閘道,保護資料寫入、動態程式碼執行和業務規則。
LlamaIndex 與 Kaggle 推出 ExtractBench,一個用於評估企業文件結構化資料抽取系統的開放基準。基準涵蓋 370 份企業文件(4,869 頁)、8 個業務領域及 67 種文件類型,評估 14 套系統的準確度、感知質素、表格結構、文件長度及成本。
Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。
LlamaIndex 在 LlamaParse Platform 推出 Turbo Beta 文件抽取層,面向低延遲的即時工作流。在 ExtractBench 上,Turbo 比 Cost Effective 快約 4 倍,單頁中位處理時間為 3.7 秒,F1 為 0.84;它直接從文件頁面抽取內容並行處理,中、長文件約為每頁 0.5 秒。
LlamaParse 用於從 PDF 擷取表格,重建文字的列欄關係,並輸出可供下游系統驗證和使用的結構化資料。PDF 通常只儲存文字座標或掃描圖像;跨頁表格、合併儲存格和多行內容,會令純文字抽取及固定模板容易出現錯位或失效。
Google for Startups AI Agents Challenge 各賽道的高排名參賽方案呈現四種工程模式,包括雙向 MCP、事件驅動並行、模型回退後共用驗證,以及昂貴模型調用前的分層路由。
LlamaIndex 將先低成本解析並檢索、再對相關頁面執行 VLM-OCR 的流程稱為 Just-in-Time Agentic OCR,適用於約 10–100 份文件的臨時資料室。
多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。
Google 宣佈 ADK for Kotlin 1.0 正式推出,為 Kotlin、Android 及伺服器端開發提供 AI 智能體工具包。版本功能與 ADK 1.0 Core 完整對齊,涵蓋多智能體協調、上下文壓縮、多輪對話、人工確認和工作階段恢復。
LlamaIndex 説明如何在 Extract 中以信心分數設定自動接受與人工覆核門檻,並用代表性資料集校準至指定精確率。
Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。
LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。
LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。