Parse Gateway 按頁面複雜度路由文件解析器
LlamaIndex 的 Parse Gateway 按頁面複雜度將文件分流至 LiteParse 或相應的 LlamaParse 層級,而非整份文件使用同一解析器。
LlamaIndex 的 Parse Gateway 按頁面複雜度將文件分流至 LiteParse 或相應的 LlamaParse 層級,而非整份文件使用同一解析器。
LLM OCR 降低了難讀文件的錯誤率,但漏讀或錯認可能藏在流暢、格式整齊的結果中,令錯誤更難察覺。文章區分 OCR 後校正、VLM 原生轉錄與智能體編排,並指出欄位級準確度、來源定位和驗證流程可補足頁面級字串相似度的不足。
智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。
Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。
LlamaIndex 梳理 OCR 從基本文字擷取到生產級文件處理管線的落差,並説明 LlamaParse 如何按文件元素調用專用模型,經修正迴圈驗證後輸出 Markdown 或 JSON。
Google 開源 Credentio C++ 庫,用於驗證 C2PA Content Credentials,起步支援規格版本 2.2 和 2.4。其 API 可在開發者應用程式本地執行驗證,媒體檔案毋須傳送至雲端或外部驗證端點;驗證大型檔案時,Credentio 使用的記憶體亦少於其他方案。
LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。
Google 介紹如何以 Agent Development Kit(ADK)構建零信任 AI 智能體,並以 Gemini 驅動的客服退款智能體作示範。文章提出三層防護,分別以硬件支援的簽名、gVisor 沙箱及確定性語義閘道,保護資料寫入、動態程式碼執行和業務規則。
LlamaIndex 與 Kaggle 推出 ExtractBench,一個用於評估企業文件結構化資料抽取系統的開放基準。基準涵蓋 370 份企業文件(4,869 頁)、8 個業務領域及 67 種文件類型,評估 14 套系統的準確度、感知質素、表格結構、文件長度及成本。
Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。
LlamaIndex 在 LlamaParse Platform 推出 Turbo Beta 文件抽取層,面向低延遲的即時工作流。在 ExtractBench 上,Turbo 比 Cost Effective 快約 4 倍,單頁中位處理時間為 3.7 秒,F1 為 0.84;它直接從文件頁面抽取內容並行處理,中、長文件約為每頁 0.5 秒。
LlamaParse 用於從 PDF 擷取表格,重建文字的列欄關係,並輸出可供下游系統驗證和使用的結構化資料。PDF 通常只儲存文字座標或掃描圖像;跨頁表格、合併儲存格和多行內容,會令純文字抽取及固定模板容易出現錯位或失效。
Google for Startups AI Agents Challenge 各賽道的高排名參賽方案呈現四種工程模式,包括雙向 MCP、事件驅動並行、模型回退後共用驗證,以及昂貴模型調用前的分層路由。
LlamaIndex 將先低成本解析並檢索、再對相關頁面執行 VLM-OCR 的流程稱為 Just-in-Time Agentic OCR,適用於約 10–100 份文件的臨時資料室。
多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。
Google 宣佈 ADK for Kotlin 1.0 正式推出,為 Kotlin、Android 及伺服器端開發提供 AI 智能體工具包。版本功能與 ADK 1.0 Core 完整對齊,涵蓋多智能體協調、上下文壓縮、多輪對話、人工確認和工作階段恢復。
LlamaIndex 説明如何在 Extract 中以信心分數設定自動接受與人工覆核門檻,並用代表性資料集校準至指定精確率。
Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。
LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。
LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。
LlamaIndex 更新 LiteParse,PDFium 優化令文字抽取耗時減少 20-25%,並改善 Markdown 解析表現,新增視覺定位及 is-complex API。
LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。
LlamaIndex 發佈文件抽取智能體 Extract v2.5,提升所有檔位的準確度,且每頁收費不變。ExtractBench 上,Cost Effective 的整體 value F1 由 87.1 升至 93.9,Agentic 由 89.8 升至 95.8,Agentic Plus 由 95.1 升至 96.4。
LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。
Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。
表格 OCR 透過表格偵測、結構辨識與資料擷取,將文件中的表格轉為 JSON、CSV 或 Excel 等機器可讀格式。LlamaParse 的發票示例會重建行列及欄位關係,並把數值映射至指定 schema。算術、資料類型及跨欄位一致性檢查,有助避免結構錯配流入企業工作流程。
現代非結構化資料抽取結合 NLP、NER 與 LLM,從文件擷取可查詢的結構化資訊,供下游系統處理。實際流程包括文件匯入、OCR 與分塊等預處理、提示詞抽取、資料驗證及輸出整合。LLM 的 zero-shot 能力無需領域專用訓練例子,可降低新增文件類型的成本。
DiffGate 提出結果門控目標,將 GRPO 與按羣組難度調整的有界教師指導結合,只對失敗軌跡施加教師監督。在 Qwen3-0.6B 和 Qwen3-1.7B 上,程式碼 avg@8 較對應的 GRPO 分別提升 +1.7、+1.8 分,pass@8 提升 +1.6、+5.7 分;數學 pass@8 則提升 +1.1、+3.9 分,avg@8 與 GRPO 相差不超過 0.5 分。
這篇綜述以大型語言模型為重點,梳理其所涉及的數值線性代數方法。機器學習中的許多工具,尤其是大型語言模型,均以矩陣和張量方法為基礎。文章旨在向數值方法專家闡明大型語言模型的核心概念,檢視相關技術採用的數值線性代數概念,並指出數值線性代數近期對機器學習的重要貢獻。
研究提出持續表徵學習,讓漂移模型直接從像素學習有效的判別性表徵,無需預訓練編碼器。在多個數據集上,該方法令原有像素空間漂移模型的 FID 降低約 82-95%。調整預訓練表徵及採用速度裁剪可進一步提升效果。
Magic-W0 是面向物理智能的世界動作基礎模型,聯合建模結構化物理狀態演變與連續動作,並以當前狀態、轉換及未來狀態表示互動。在 RoboDojo-Sim 上,Magic-W0 平均得分為 27.10,在受比較的世界動作模型中最高。在多項真實機械人任務中,模型以有限下游數據微調後仍展現良好表現,支持其泛化及快速適應能力。
DistScene 提出單張圖片組合式 3D 場景生成框架,聯合建模環境與個別物件。框架透過 Object-to-Scene Distillation,以自動組合及渲染的合成場景,把預訓練物件生成先驗轉移至場景生成。在室內及室外基準測試中,DistScene 的場景層級空間連貫性優於參與比較的基線方法。
特斯拉正持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地的申請,並按首輪技術審查意見進一步優化道路測試計劃架構。測試路線除涵蓋法規要求場景,亦將納入由城市至鄉村的多種交通環境,以驗證系統對當地機動車與摩托車混行及交通規則的適應能力。公司將完善路線與場景規劃,推進系統取得相關審核認可。
MemoMind One 將於明日進駐全國 56 家線下門店及 INNO100 全球創新旗艦店,並開放定金預訂。10 月 3 日至 10 月 14 日到店預付 100 元定金,可獲贈價值 199 元墨鏡夾片 1 副。官方稱眼鏡具備 AI 記憶、導航和提詞功能,結合極米顯示、蔡司光學與哈曼聲學,目前尚未公佈配置資訊。
東京法院在津田健次郎起訴 TikTok 案中,首次確認人的聲音受法律保護,並認定未經許可使用其聲音侵犯形象權。案件涉及匿名帳號用 AI 克隆其聲音為影片旁白;因帳號已註銷,法院未支持津田要求 TikTok 下架影片的請求。
大眾安徽與眾 09 夏測實車亮相,並已開啟預售,售價 19.99 萬元起。新車搭載端到端智能輔助駕駛模型,可實現高速/城區 NOA 和車位到車位 AI 代駕,並標配圖靈 AI 晶片,總算力 750TOPS。
Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。
小鵬汽車表示,MONA L03 9 月交付超 14,000 台,年輕用户佔比過半。一線、新一線及二線城市佔七成,超九成訂單選擇 Max / Ultra SE,輔助駕駛里程累積超 7 億公里。
Anthropic 在 IPO 招股書中警告,美國政府對公司及其技術的態度可能影響政府業務,並延伸至商業客户和合作夥伴,甚至波及人類文明。
湖北省自 2026 年 10 月 1 日起擴大智能家居及相關消費品補貼範圍,新增機械人、數碼相機、無人機、血壓儀等品類。個人消費者在參與商家購買補貼範圍內產品,可按扣除各環節優惠後的最終售價獲 15% 補貼,每類產品限 1 件、每件不超過 1500 元。數碼及智能產品、家電仍參與國補。