LlamaIndex 分享為 Claude Code 加入文件理解能力的三種做法
LlamaIndex 介紹為 Claude Code 加入文件理解能力的三種做法,涵蓋 MCP 文件檢索、CLI 文件操作,以及以 CLAUDE.md 指引工作流建置。
LlamaIndex 介紹為 Claude Code 加入文件理解能力的三種做法,涵蓋 MCP 文件檢索、CLI 文件操作,以及以 CLAUDE.md 指引工作流建置。
文件處理中,解析會把文件轉成供 AI 使用、並保留內容、結構與脈絡的格式;擷取則依預設 schema 抽出指定欄位,輸出結構化資料。解析適用於搜尋問答、RAG,以及需要保留文件脈絡的場景;擷取則適用於填入資料庫、處理表單和自動化業務流程。擷取並非取代解析,而是建立在解析之上,須先將文件轉成機器可讀內容,再識別、驗證並整理目標欄位。
LlamaIndex 示範以 Agent Workflows、OpenTelemetry 和 Jaeger,為財務文件分類及資料抽取流程建立可觀測性。範例用 LlamaClassify 將文件分類為損益表、現金流量表或資產負債表,再按類型以 LlamaExtract 擷取結構化資料;Jaeger 可查看一條 trace 中收集的五個 spans 和各步耗時。
LlamaIndex 示範如何結合 AgentFS、LlamaParse、Claude Agent SDK 和 LlamaIndex Workflows,為 Claude Code 建立受控的檔案存取環境。
LlamaParse 與 LlamaAgents 結合,構建處理後勤文件的多步驟智能體工作流程。LlamaParse 提供 LlamaSplit、LlamaClassify、LlamaExtract 及保留語義結構的文件解析;LlamaAgents Workflows 負責協調多份文件並行處理,並支援人工介入。
LlamaIndex 比較了智能體使用技能與 MCP 工具的取捨,指出 MCP 適合輸入輸出明確、要求可預測執行的操作,技能則適合以自然語言提供行為指引。MCP 以固定 schema 的 API 呼叫執行,但通常需要一定開發知識並帶來網絡延遲;技能以本地檔案提供指示,設定較輕,卻可能因 LLM 解讀而產生誤判或幻覺。
LlamaIndex 示範使用 LlamaAgents Builder 建立私募股權交易尋源智能體,用於分類交易並擷取初步評估指標。智能體會把交易歸入 buyout、growth 或 minority,並提取 Revenue、EBITDA、Growth rate、ARR / MRR、Margins 和 Debt levels。
LlamaIndex 建立了 audio-kb CLI 工具,讓使用者可從終端錄製或上傳音訊筆記,並對筆記進行語義搜尋。工具以 LlamaParse 提取逐字稿,將文本分塊後用 Gemini Embedding 2 產生嵌入向量,再存入帶有 HNSW 索引的本地 SurrealDB。
LlamaParse 以多模態模型解析法律證據開示文件,可處理低畫質掃描件,並理解頁面版面、圖片、圖表及表格。它支援自訂解析指示,API 可回傳「markdown」、「text」及「items」等輸出。文章建議這類文件使用 `tier="agentic_plus"`,該層級針對複雜版面與視覺內容優化;所有 tier 均採用高解析度 OCR。
圖表數據提取須將圖中的視覺標記映射為座標數值,再整理成結構化資料;流程包括識別圖表類型、解析座標軸與圖例、定位數據點及匯出。人工數位化通常每張圖需 15 至 30 分鐘,傳統 OCR 只能辨識文字;AI/VLM(如 LlamaParse)可處理多種圖表,並輸出 CSV、JSON 或 Markdown,附信心分數與引用。
法律文件 OCR 的結構錯誤與字符誤讀會妨礙 eDiscovery 搜尋、合約審查及合規記錄,並帶來法律風險。複雜版面下,傳統 OCR 的字符錯誤率為 3–8%;準確率達 98% 時,處理 50,000 頁仍有 1,000 頁出錯。文章探討智能體方法如何縮小差距,以及評估法律工作流程 OCR 軟件時應關注的因素。
要構建可靠的 OCR 流程,須整合文件輸入、影像預處理、文字檢測與識別、版面解析及驗證,將掃描件、PDF 和圖片轉為可供後續系統使用的結構化資料。文件格式、影像品質及表格與多欄版面各異,單靠字元識別容易遺失欄位、表格與文件區段之間的關係,各處理階段須協同運作以確保輸出可靠。
2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。
LlamaIndex 復盤 LlamaParse 文件處理流程中的兩類生產故障:模型重複輸出造成延遲與資源耗盡,recitation 內容攔截則令生成中止並使下游流程出錯。
OCR 透過辨識掃描 PDF 中的像素字形,將影像文字轉成可搜尋、可選取的機器可讀文字。輸出可保留掃描影像並加入隱藏文字層,亦可用可編輯文字取代掃描影像。遇上多欄排版,閲讀次序可能被打亂;表格亦可能攤平成無結構文字,令辨識結果難以供機器使用。
可靠的金融文件欄位擷取範本不能只列欄位,還須定義資料型別、結構、預期位置及驗證規則,以免系統因版面差異而靜默輸出錯誤數值。發票與銀行結單應採用分開的模組化結構並共用驗證層;OCR 之外,處理層亦須理解文件版面,否則規則式定位及逐頁擷取可能造成錯值、交易列遺漏或重複。
LiteParse 以網格投影演算法將 PDF 文字座標重建為純文字,利用等寬字元網格保留空間排列與對齊結構。演算法按 Y 座標容差將文字片段分行,並抽取左、右及置中錨點,將內容吸附至相應位置。空白壓縮可把 4 個空格的欄距縮為 2 個,以保留 LLM tokens 並維持版面資訊;GridDebugLogger 則可追蹤處理流程中的判斷。
這套按揭收入核驗流程以 LlamaParse Extract 從貸款申請、W-2、糧單及銀行月結單抽取結構化資料,再由 Claude 交叉核驗並生成自包含 HTML 報告。
這個示範應用以 LiteParse 建立財務盡職調查 AI 智能體,可匯入 SEC 申報文件、跨文件搜尋並回答問題,並在原始 PDF 頁面高亮精確引用位置。
護照的 MRZ 不只是兩行待辨識文字,而是依 ICAO Document 9303 編碼、附有校驗碼的身份紀錄;TD3 格式每行 44 個字符,欄位校驗碼按 7-3-1 權重計算並取 modulo 10。只抽取字符而不驗證校驗碼,或不比對 VIZ 與 MRZ,便可能漏掉辨識錯誤及篡改差異。交叉驗證亦可在 VIZ 遭全息圖眩光遮擋時參照 MRZ 資料,並標記差異供審核。
貸款文件自動化的成敗取決於擷取與文件分類的準確度;只自動化流程轉送、沿用傳統 OCR,仍無法消除人工核對。採用 AI 決策但仍以舊式 OCR 擷取的貸款機構,仍須人工審查 40-60% 的檔案。Agentic OCR 會按頁面與元素類型識別文件、選擇模型並驗證擷取值,簡化後續收入計算、條件追蹤及承保審查。
保險理賠文件的 OCR 處理須超越文字辨識,重建結構化資料並保存欄位關聯,以支援理賠處理。系統結合機器學習、電腦視覺與版面感知解析,再按業務規則、保單保障及佐證文件驗證擷取值。信心評分用於判斷資料可否自動處理或須人工覆核;驗證後的資料可整合至理賠系統,支援自動決策、合規報告與分析工作流程。
Logan(LlamaIndex 的 Head of OSS)在 NYC 工作坊帶領開發者用 LlamaParse 建立貸款審核流程,處理薪資單與券商結單 PDF,抽取結構化資料並進行跨文件分析。
Adobe Acrobat 的 Scan & OCR 可用四次點擊為掃描 PDF 建立文字層,讓單份文件可用 Ctrl+F 搜尋,但不保證大量檔案檢索準確。單份低敏感文件可用免費線上 OCR,機密批次掃描則可用本機 OCRmyPDF;Google Drive 會把文字轉成新 Doc,而非可搜尋 PDF。
貸款處理指南示範以 LlamaParse 建立自動化文件擷取流程,涵蓋由申請到批核的多類貸款文件。流程按文件特性選用 Cost-Effective、Balanced、Premium 或 Agentic 模式,並透過跨文件核驗檢查税表收入、銀行存款、借款實體及估值等資料的一致性。
智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。
LlamaIndex 梳理 OCR 從基本文字擷取到生產級文件處理管線的落差,並説明 LlamaParse 如何按文件元素調用專用模型,經修正迴圈驗證後輸出 Markdown 或 JSON。
LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。
Google 介紹如何以 Agent Development Kit(ADK)構建零信任 AI 智能體,並以 Gemini 驅動的客服退款智能體作示範。文章提出三層防護,分別以硬件支援的簽名、gVisor 沙箱及確定性語義閘道,保護資料寫入、動態程式碼執行和業務規則。
Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。
LlamaParse 用於從 PDF 擷取表格,重建文字的列欄關係,並輸出可供下游系統驗證和使用的結構化資料。PDF 通常只儲存文字座標或掃描圖像;跨頁表格、合併儲存格和多行內容,會令純文字抽取及固定模板容易出現錯位或失效。
Google for Startups AI Agents Challenge 各賽道的高排名參賽方案呈現四種工程模式,包括雙向 MCP、事件驅動並行、模型回退後共用驗證,以及昂貴模型調用前的分層路由。
LlamaIndex 將先低成本解析並檢索、再對相關頁面執行 VLM-OCR 的流程稱為 Just-in-Time Agentic OCR,適用於約 10–100 份文件的臨時資料室。
LlamaIndex 説明如何在 Extract 中以信心分數設定自動接受與人工覆核門檻,並用代表性資料集校準至指定精確率。
Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。
LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。
LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。
LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。
LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。
Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。