跳到正文

#部署/工程

今日 16 條
10月3日週六
  1. LlamaIndex:產品、工程與評測48

    LlamaParse 改善 Word(.docx)文件的表格解析

    LlamaParse 更新了 Word(.docx)文件的表格解析方式,改為直接從 Word XML 擷取表格內容並保留原始結構。其專有技術會將 Word XML 表格元素對應至渲染結果中的正確頁面位置,並把 XML 表格內容轉換為 Markdown;這項更新目前適用於 .docx 表格。

  2. LlamaIndex:產品、工程與評測29

    法律文件 OCR:準確度與合規要求

    法律文件 OCR 的結構錯誤與字符誤讀會妨礙 eDiscovery 搜尋、合約審查及合規記錄,並帶來法律風險。複雜版面下,傳統 OCR 的字符錯誤率為 3–8%;準確率達 98% 時,處理 50,000 頁仍有 1,000 頁出錯。文章探討智能體方法如何縮小差距,以及評估法律工作流程 OCR 軟件時應關注的因素。

  3. LlamaIndex:產品、工程與評測30

    建構 OCR 流程:提升效率的步驟

    要構建可靠的 OCR 流程,須整合文件輸入、影像預處理、文字檢測與識別、版面解析及驗證,將掃描件、PDF 和圖片轉為可供後續系統使用的結構化資料。文件格式、影像品質及表格與多欄版面各異,單靠字元識別容易遺失欄位、表格與文件區段之間的關係,各處理階段須協同運作以確保輸出可靠。

  4. LlamaIndex:產品、工程與評測38

    金融文件欄位擷取範本:多數流程常犯的錯誤

    可靠的金融文件欄位擷取範本不能只列欄位,還須定義資料型別、結構、預期位置及驗證規則,以免系統因版面差異而靜默輸出錯誤數值。發票與銀行結單應採用分開的模組化結構並共用驗證層;OCR 之外,處理層亦須理解文件版面,否則規則式定位及逐頁擷取可能造成錯值、交易列遺漏或重複。

  5. LlamaIndex:產品、工程與評測48

    LiteParse 如何將 PDF 轉為文字:深入剖析網格投影演算法

    LiteParse 以網格投影演算法將 PDF 文字座標重建為純文字,利用等寬字元網格保留空間排列與對齊結構。演算法按 Y 座標容差將文字片段分行,並抽取左、右及置中錨點,將內容吸附至相應位置。空白壓縮可把 4 個空格的欄距縮為 2 個,以保留 LLM tokens 並維持版面資訊;GridDebugLogger 則可追蹤處理流程中的判斷。

  6. LlamaIndex:產品、工程與評測37

    護照 OCR:為何 MRZ 不只是兩行文字

    護照的 MRZ 不只是兩行待辨識文字,而是依 ICAO Document 9303 編碼、附有校驗碼的身份紀錄;TD3 格式每行 44 個字符,欄位校驗碼按 7-3-1 權重計算並取 modulo 10。只抽取字符而不驗證校驗碼,或不比對 VIZ 與 MRZ,便可能漏掉辨識錯誤及篡改差異。交叉驗證亦可在 VIZ 遭全息圖眩光遮擋時參照 MRZ 資料,並標記差異供審核。

  7. LlamaIndex:產品、工程與評測29

    貸款文件自動化:為何擷取層決定流程成敗

    貸款文件自動化的成敗取決於擷取與文件分類的準確度;只自動化流程轉送、沿用傳統 OCR,仍無法消除人工核對。採用 AI 決策但仍以舊式 OCR 擷取的貸款機構,仍須人工審查 40-60% 的檔案。Agentic OCR 會按頁面與元素類型識別文件、選擇模型並驗證擷取值,簡化後續收入計算、條件追蹤及承保審查。

  8. LlamaIndex:產品、工程與評測45

    智能 OCR:構建生產級文件理解系統

    智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。

  9. LlamaIndex:產品、工程與評測61

    LlamaIndex 如何利用 Temporal 擴展可靠的文件編排

    LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。

  10. LlamaIndex:產品、工程與評測53

    OCR 文件處理:為何更好的抽取器未能縮短人工審核佇列

    LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。

  11. LlamaIndex:產品、工程與評測55

    AI 文件抽取為何容易在 Schema 設計上出錯

    LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。

  12. LlamaIndex:產品、工程與評測30

    LlamaParse 應付帳款 OCR:效益、挑戰與最佳實踐

    LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。

  13. LlamaIndex:產品、工程與評測31

    LlamaParse 表格 OCR:如何從文件提取結構化資料

    表格 OCR 透過表格偵測、結構辨識與資料擷取,將文件中的表格轉為 JSON、CSV 或 Excel 等機器可讀格式。LlamaParse 的發票示例會重建行列及欄位關係,並把數值映射至指定 schema。算術、資料類型及跨欄位一致性檢查,有助避免結構錯配流入企業工作流程。

  14. IT之家48

    特斯拉持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地,進一步優化道路測試計劃

    特斯拉正持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地的申請,並按首輪技術審查意見進一步優化道路測試計劃架構。測試路線除涵蓋法規要求場景,亦將納入由城市至鄉村的多種交通環境,以驗證系統對當地機動車與摩托車混行及交通規則的適應能力。公司將完善路線與場景規劃,推進系統取得相關審核認可。

  15. OpenAI Developers:Blog76

    OpenAI 分享以 Skills、託管 shell 與服務端 compaction 建構長時間運行智能體的實作技巧

    OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。

    推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。

  16. AWS Machine Learning Blog61

    Claude Platform on AWS 多環境存取實作指南

    AWS Machine Learning Blog 提供 Claude Platform on AWS 多環境存取指南,示範為 AWS 工作負載、開發者筆電及外部環境配置推理存取。

    推薦理由:文章按 AWS 工作負載、開發者筆電與外部環境,示範 cross-account SigV4、workspace-scoped API key 和 OIDC federation 如何配置,並維持 workspace 隔離。

  17. Tessl:產品與工程博客50

    AI 智能體轉型中的上下文由誰擁有?

    AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。

  18. Tessl:產品與工程博客60

    「一個大腦」意味着掌握組織記憶

    Leapfrog 團隊的作者分享以 OpenClaw、GitHub、Obsidian 和 Telegram 搭建組織記憶系統,讓團隊可透過智能體以自然語言查詢公司知識與客户脈絡。研究庫當時約有 1,200 個檔案,另設客户資料庫;系統區分個人、領導層、公司與客户知識,只把經判斷扎實且有用的研究升格分享。作者建議先讓一人本機試行,確認維護、權限及資料安全要求,再按實際需要逐步增加檢索層。

  19. LlamaIndex:產品、工程與評測36

    AI 文件分類:自動化分揀與標記實用指南

    AI 文件分類利用訓練模型理解文件內容、結構與語境,自動分配類別及標籤,並將文件送入相應工作流程。傳統機器學習分類器須以數千份已標註文件訓練;大語言模型可根據自然語言類別描述進行零樣本分類,無須標註訓練資料。信心評分讓高信心結果直接流轉,低信心結果轉交人工審核。

  20. LlamaIndex:產品、工程與評測30

    KYC 自動化:如何以可擴展且合規的工作流程取代人工核驗

    KYC 自動化以軟件執行文件擷取、身份核驗、制裁篩查和風險評分,將人工審核集中於例外個案。標準案件的處理時間可由數天至數星期降至數分鐘至數小時,並留下完整、帶時間戳且可核查的審計紀錄。LlamaParse 以智能體式文件解析、版面感知電腦視覺及多重驗證迴圈,將不同格式文件轉為結構化資料。