跳到正文

全部動態

今日 23 條
10月3日週六
  1. LlamaIndex:產品、工程與評測50

    LlamaIndex:解析與擷取——理解文件處理的兩種基本方法

    文件處理中,解析會把文件轉成供 AI 使用、並保留內容、結構與脈絡的格式;擷取則依預設 schema 抽出指定欄位,輸出結構化資料。解析適用於搜尋問答、RAG,以及需要保留文件脈絡的場景;擷取則適用於填入資料庫、處理表單和自動化業務流程。擷取並非取代解析,而是建立在解析之上,須先將文件轉成機器可讀內容,再識別、驗證並整理目標欄位。

  2. LlamaIndex:產品、工程與評測56

    LlamaIndex 示範如何為智能體文件工作流程建立可觀測性

    LlamaIndex 示範以 Agent Workflows、OpenTelemetry 和 Jaeger,為財務文件分類及資料抽取流程建立可觀測性。範例用 LlamaClassify 將文件分類為損益表、現金流量表或資產負債表,再按類型以 LlamaExtract 擷取結構化資料;Jaeger 可查看一條 trace 中收集的五個 spans 和各步耗時。

  3. LlamaIndex:產品、工程與評測53

    智能體何時該用技能、何時該用 MCP 工具?LlamaIndex 比較兩者適用情境

    LlamaIndex 比較了智能體使用技能與 MCP 工具的取捨,指出 MCP 適合輸入輸出明確、要求可預測執行的操作,技能則適合以自然語言提供行為指引。MCP 以固定 schema 的 API 呼叫執行,但通常需要一定開發知識並帶來網絡延遲;技能以本地檔案提供指示,設定較輕,卻可能因 LLM 解讀而產生誤判或幻覺。

  4. LlamaIndex:產品、工程與評測47

    解析難以辨讀的文件:LlamaParse 如何處理訴訟證據開示文件

    LlamaParse 以多模態模型解析法律證據開示文件,可處理低畫質掃描件,並理解頁面版面、圖片、圖表及表格。它支援自訂解析指示,API 可回傳「markdown」、「text」及「items」等輸出。文章建議這類文件使用 `tier="agentic_plus"`,該層級針對複雜版面與視覺內容優化;所有 tier 均採用高解析度 OCR。

  5. LlamaIndex:產品、工程與評測45

    LlamaIndex:圖表數據提取逐步指南

    圖表數據提取須將圖中的視覺標記映射為座標數值,再整理成結構化資料;流程包括識別圖表類型、解析座標軸與圖例、定位數據點及匯出。人工數位化通常每張圖需 15 至 30 分鐘,傳統 OCR 只能辨識文字;AI/VLM(如 LlamaParse)可處理多種圖表,並輸出 CSV、JSON 或 Markdown,附信心分數與引用。

  6. LlamaIndex:產品、工程與評測29

    法律文件 OCR:準確度與合規要求

    法律文件 OCR 的結構錯誤與字符誤讀會妨礙 eDiscovery 搜尋、合約審查及合規記錄,並帶來法律風險。複雜版面下,傳統 OCR 的字符錯誤率為 3–8%;準確率達 98% 時,處理 50,000 頁仍有 1,000 頁出錯。文章探討智能體方法如何縮小差距,以及評估法律工作流程 OCR 軟件時應關注的因素。

  7. LlamaIndex:產品、工程與評測30

    建構 OCR 流程:提升效率的步驟

    要構建可靠的 OCR 流程,須整合文件輸入、影像預處理、文字檢測與識別、版面解析及驗證,將掃描件、PDF 和圖片轉為可供後續系統使用的結構化資料。文件格式、影像品質及表格與多欄版面各異,單靠字元識別容易遺失欄位、表格與文件區段之間的關係,各處理階段須協同運作以確保輸出可靠。

  8. LlamaIndex:產品、工程與評測26

    2026 年面向全球文件辨識的最佳多語言 OCR 軟件

    2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。

  9. LlamaIndex:產品、工程與評測34

    PDF 字元辨識:OCR 如何運作及在哪些情況下失效

    OCR 透過辨識掃描 PDF 中的像素字形,將影像文字轉成可搜尋、可選取的機器可讀文字。輸出可保留掃描影像並加入隱藏文字層,亦可用可編輯文字取代掃描影像。遇上多欄排版,閲讀次序可能被打亂;表格亦可能攤平成無結構文字,令辨識結果難以供機器使用。

  10. LlamaIndex:產品、工程與評測38

    金融文件欄位擷取範本:多數流程常犯的錯誤

    可靠的金融文件欄位擷取範本不能只列欄位,還須定義資料型別、結構、預期位置及驗證規則,以免系統因版面差異而靜默輸出錯誤數值。發票與銀行結單應採用分開的模組化結構並共用驗證層;OCR 之外,處理層亦須理解文件版面,否則規則式定位及逐頁擷取可能造成錯值、交易列遺漏或重複。

  11. LlamaIndex:產品、工程與評測48

    LiteParse 如何將 PDF 轉為文字:深入剖析網格投影演算法

    LiteParse 以網格投影演算法將 PDF 文字座標重建為純文字,利用等寬字元網格保留空間排列與對齊結構。演算法按 Y 座標容差將文字片段分行,並抽取左、右及置中錨點,將內容吸附至相應位置。空白壓縮可把 4 個空格的欄距縮為 2 個,以保留 LLM tokens 並維持版面資訊;GridDebugLogger 則可追蹤處理流程中的判斷。

  12. LlamaIndex:產品、工程與評測37

    護照 OCR:為何 MRZ 不只是兩行文字

    護照的 MRZ 不只是兩行待辨識文字,而是依 ICAO Document 9303 編碼、附有校驗碼的身份紀錄;TD3 格式每行 44 個字符,欄位校驗碼按 7-3-1 權重計算並取 modulo 10。只抽取字符而不驗證校驗碼,或不比對 VIZ 與 MRZ,便可能漏掉辨識錯誤及篡改差異。交叉驗證亦可在 VIZ 遭全息圖眩光遮擋時參照 MRZ 資料,並標記差異供審核。

  13. LlamaIndex:產品、工程與評測29

    貸款文件自動化:為何擷取層決定流程成敗

    貸款文件自動化的成敗取決於擷取與文件分類的準確度;只自動化流程轉送、沿用傳統 OCR,仍無法消除人工核對。採用 AI 決策但仍以舊式 OCR 擷取的貸款機構,仍須人工審查 40-60% 的檔案。Agentic OCR 會按頁面與元素類型識別文件、選擇模型並驗證擷取值,簡化後續收入計算、條件追蹤及承保審查。

  14. LlamaIndex:產品、工程與評測27

    保險文件 OCR:改造理賠流程

    保險理賠文件的 OCR 處理須超越文字辨識,重建結構化資料並保存欄位關聯,以支援理賠處理。系統結合機器學習、電腦視覺與版面感知解析,再按業務規則、保單保障及佐證文件驗證擷取值。信心評分用於判斷資料可否自動處理或須人工覆核;驗證後的資料可整合至理賠系統,支援自動決策、合規報告與分析工作流程。

  15. LlamaIndex:產品、工程與評測45

    智能 OCR:構建生產級文件理解系統

    智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。

  16. LlamaIndex:產品、工程與評測61

    LlamaIndex 如何利用 Temporal 擴展可靠的文件編排

    LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。

  17. Google Developers Blog63

    ADK 如何評估即時語音智能體

    Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。

  18. Google Developers Blog60

    Harness Engineering 剖析:如何評估、迭代及為 AI 編碼智能體設置防護

    Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。

  19. LlamaIndex:產品、工程與評測53

    OCR 文件處理:為何更好的抽取器未能縮短人工審核佇列

    LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。

  20. LlamaIndex:產品、工程與評測55

    AI 文件抽取為何容易在 Schema 設計上出錯

    LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。

  21. LlamaIndex:產品、工程與評測55

    LlamaIndex 解釋 VLM 為何難以解析表格

    LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。

  22. LlamaIndex:產品、工程與評測30

    LlamaParse 應付帳款 OCR:效益、挑戰與最佳實踐

    LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。

  23. LlamaIndex:產品、工程與評測27

    甚麼是 Agentic OCR?智能文件自動化的下一階段

    Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。