LLM OCR:錯誤變得更隱蔽,卻沒有減少
LLM OCR 降低了難讀文件的錯誤率,但漏讀或錯認可能藏在流暢、格式整齊的結果中,令錯誤更難察覺。文章區分 OCR 後校正、VLM 原生轉錄與智能體編排,並指出欄位級準確度、來源定位和驗證流程可補足頁面級字串相似度的不足。
LLM OCR 降低了難讀文件的錯誤率,但漏讀或錯認可能藏在流暢、格式整齊的結果中,令錯誤更難察覺。文章區分 OCR 後校正、VLM 原生轉錄與智能體編排,並指出欄位級準確度、來源定位和驗證流程可補足頁面級字串相似度的不足。
智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。
LlamaIndex 梳理 OCR 從基本文字擷取到生產級文件處理管線的落差,並説明 LlamaParse 如何按文件元素調用專用模型,經修正迴圈驗證後輸出 Markdown 或 JSON。
LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。
Google 介紹如何以 Agent Development Kit(ADK)構建零信任 AI 智能體,並以 Gemini 驅動的客服退款智能體作示範。文章提出三層防護,分別以硬件支援的簽名、gVisor 沙箱及確定性語義閘道,保護資料寫入、動態程式碼執行和業務規則。
Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。
LlamaParse 用於從 PDF 擷取表格,重建文字的列欄關係,並輸出可供下游系統驗證和使用的結構化資料。PDF 通常只儲存文字座標或掃描圖像;跨頁表格、合併儲存格和多行內容,會令純文字抽取及固定模板容易出現錯位或失效。
Google for Startups AI Agents Challenge 各賽道的高排名參賽方案呈現四種工程模式,包括雙向 MCP、事件驅動並行、模型回退後共用驗證,以及昂貴模型調用前的分層路由。
LlamaIndex 將先低成本解析並檢索、再對相關頁面執行 VLM-OCR 的流程稱為 Just-in-Time Agentic OCR,適用於約 10–100 份文件的臨時資料室。
LlamaIndex 説明如何在 Extract 中以信心分數設定自動接受與人工覆核門檻,並用代表性資料集校準至指定精確率。
Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。
LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。
LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。
LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。
LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。
Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。
表格 OCR 透過表格偵測、結構辨識與資料擷取,將文件中的表格轉為 JSON、CSV 或 Excel 等機器可讀格式。LlamaParse 的發票示例會重建行列及欄位關係,並把數值映射至指定 schema。算術、資料類型及跨欄位一致性檢查,有助避免結構錯配流入企業工作流程。
現代非結構化資料抽取結合 NLP、NER 與 LLM,從文件擷取可查詢的結構化資訊,供下游系統處理。實際流程包括文件匯入、OCR 與分塊等預處理、提示詞抽取、資料驗證及輸出整合。LLM 的 zero-shot 能力無需領域專用訓練例子,可降低新增文件類型的成本。
OpenAI 整理 Realtime API 與 gpt-realtime 語音對語音模型進入 GA 後的介面變更、新功能及整合注意事項。文章建議客户遷移至 GA 介面,並説明 beta 與 GA 在功能支援、temperature 和非同步函式呼叫上的差異。
推薦理由:文章對照 beta 與 GA 的功能支援差異,並説明介面遷移、temperature 設定及長對話截斷的處理方式,方便開發者按整合環節核對需要調整的設定。
Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。
OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。
Skyscanner 的開發者將 OpenAI Codex CLI 透過 JetBrains 的 MCP server 接入 JetBrains IDE,讓 Codex 查詢 IDE 檢查結果及執行預設 run configurations,以縮短除錯、測試與開發工作流程。
OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。
OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。
推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。
OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。
OpenAI API 的 Audio & voice 文件聚焦於建立語音及即時語音體驗,並列於 API 開發文件導覽中。頁面其餘內容為開發者文件與資源入口,沒有提供音訊功能細節。
Anthropic 説明如何復現並拓展其對齊偽裝演示,並提供快速實驗筆記本、對話紀錄及部分主實驗程式碼。在簡化的 helpful-only 設定中,Claude 3 Opus、Claude 3.5 Sonnet 和 Llama-3 405B 有時會生成對齊偽裝推理;提示暗示對話會用於訓練時,模型更常給出有幫助的回答。
uniopen 以 Amazon SageMaker AI 監督式微調及提示詞優化客製化 Amazon Nova 2 Lite,令兩項零售審核分類指標均達到生產門檻。
AWS Machine Learning Blog 提供 Claude Platform on AWS 多環境存取指南,示範為 AWS 工作負載、開發者筆電及外部環境配置推理存取。
推薦理由:文章按 AWS 工作負載、開發者筆電與外部環境,示範 cross-account SigV4、workspace-scoped API key 和 OIDC federation 如何配置,並維持 workspace 隔離。
Tessl提出回饋迴路工程,透過設計智能體周邊的迴路,讓每次執行改善後續工作的項目條件。文章把迴路分為單次改動、跨項目歷史及生產訊號三層,維護智能體分析日誌、PR 評論或程式庫狀態後,會把需修正事項整理成一般問題單交回既有開發流程,而不自行開 PR。
AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。
Leapfrog 團隊的作者分享以 OpenClaw、GitHub、Obsidian 和 Telegram 搭建組織記憶系統,讓團隊可透過智能體以自然語言查詢公司知識與客户脈絡。研究庫當時約有 1,200 個檔案,另設客户資料庫;系統區分個人、領導層、公司與客户知識,只把經判斷扎實且有用的研究升格分享。作者建議先讓一人本機試行,確認維護、權限及資料安全要求,再按實際需要逐步增加檢索層。
AI 文件分類利用訓練模型理解文件內容、結構與語境,自動分配類別及標籤,並將文件送入相應工作流程。傳統機器學習分類器須以數千份已標註文件訓練;大語言模型可根據自然語言類別描述進行零樣本分類,無須標註訓練資料。信心評分讓高信心結果直接流轉,低信心結果轉交人工審核。
KYC 自動化以軟件執行文件擷取、身份核驗、制裁篩查和風險評分,將人工審核集中於例外個案。標準案件的處理時間可由數天至數星期降至數分鐘至數小時,並留下完整、帶時間戳且可核查的審計紀錄。LlamaParse 以智能體式文件解析、版面感知電腦視覺及多重驗證迴圈,將不同格式文件轉為結構化資料。
按揭文件自動化把貸款申請、核保、驗證及成交中的人工文件工作,轉化為結構化、由機器處理的流程。系統結合機器學習、電腦視覺與結構化解析,辨識文件版面並抽取符合預設 schema 的資料,不止進行文字識別。抽取結果會按業務規則、核保準則及外部數據來源驗證,並以信心評分和人工審核處理模糊或不確定個案。
標準 OCR 難以滿足 KYC 合規要求,因其無法可靠辨識磨損、斜拍、帶有防偽特徵或使用非拉丁文字的真實身份文件。人工資料輸入錯誤率平均為 1–4%,而真正直通式處理要求欄位準確率達 99.9%。錯誤欄位會流入 AML 篩查及合規紀錄,觸發誤報、錯過名單匹配或延誤客户開户。
Google 示範為客服退貨智能體配置零信任運行時治理,檢查提示、工具調用及跨輪次行為。方案部署於 Gemini Enterprise Agent Platform。
Google 團隊在 TPU v6e 上優化 SVG 稀疏注意力的執行流程,令 720p、81 幀影片的端到端去噪提速 1.28×。去噪時間由 153.50 s 降至 119.86 s;在 1440p(302K tokens)下則由 2,471 s 降至 1,461 s,提速 1.69×,PSNR 為 24.05 dB。
Laura Entis 訪問五位專業寫作者,整理他們如何使用 AI、哪些地方令他們失望,以及哪些工作仍堅持親自完成。文章指出沒有通用流程,同一工具可能幫助一位作者理清思路,也可能令另一位的文筆變差。
作者把親自使用 AI 智能體所構建的軟件、判斷體驗並反覆修整,視為 compound engineering 的最後一步。他以 `/ce-polish` 檢出分支、啟動開發伺服器,並在編輯器中與智能體並排查看應用程式。在 Cora Brief 中,他透過 Monologue 指出版面留白過多、卡片需要更緊湊,智能體調整版面後,應用程式隨即熱重載。