跳到正文
10月3日週六
  1. LlamaIndex:產品、工程與評測60

    LLM OCR:錯誤變得更隱蔽,卻沒有減少

    LLM OCR 降低了難讀文件的錯誤率,但漏讀或錯認可能藏在流暢、格式整齊的結果中,令錯誤更難察覺。文章區分 OCR 後校正、VLM 原生轉錄與智能體編排,並指出欄位級準確度、來源定位和驗證流程可補足頁面級字串相似度的不足。

  2. LlamaIndex:產品、工程與評測45

    智能 OCR:構建生產級文件理解系統

    智能 OCR 結合傳統字符識別、機器學習、版面分析、語義抽取與驗證邏輯,將文件轉為下游系統可用的結構化數據,而非純文字。文章探討生產級流程的架構、驗證與治理,以及企業將系統由原型推進至生產環境時須考慮的事項。

  3. Google Developers Blog35

    Go 為何是 AI 輔助軟件工程的理想語言

    Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。

  4. LlamaIndex:產品、工程與評測61

    LlamaIndex 如何利用 Temporal 擴展可靠的文件編排

    LlamaIndex 採用 Temporal 編排文件處理工作流,將處理規模擴展至每日數千萬頁,以支援其近期 Batch API 發佈。此前團隊在 RabbitMQ 上疊加狀態追蹤、重試、公平性和背壓機制;Temporal 則以持久化 Workflow 和訊號協調執行與併發限制。切換後,團隊整合並移除了此前為擴展而增加的快取層、額外微服務、分拆佇列及訊息 metadata。

  5. Google Developers Blog63

    ADK 如何評估即時語音智能體

    Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。

  6. LlamaIndex:產品、工程與評測41

    智能文件處理(IDP)平台:大多數供應商做錯了甚麼

    多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。

  7. Google Developers Blog60

    Harness Engineering 剖析:如何評估、迭代及為 AI 編碼智能體設置防護

    Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。

  8. LlamaIndex:產品、工程與評測53

    OCR 文件處理:為何更好的抽取器未能縮短人工審核佇列

    LlamaIndex 指出,OCR 文件處理的自動化率不只取決於欄位準確率,也取決於系統能否辨識可能出錯的欄位並據此分流人工審核。文章以 20 個欄位、每欄 97% 準確率為例,在理想化假設下估算整份文件全對率約 54%,並提出錯誤捕捉率作為比單看準確率更能預示自動化上限的指標。

  9. LlamaIndex:產品、工程與評測55

    AI 文件抽取為何容易在 Schema 設計上出錯

    LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。

  10. LlamaIndex:產品、工程與評測55

    LlamaIndex 解釋 VLM 為何難以解析表格

    LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。

  11. LlamaIndex:產品、工程與評測30

    LlamaParse 應付帳款 OCR:效益、挑戰與最佳實踐

    LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。

  12. LlamaIndex:產品、工程與評測27

    甚麼是 Agentic OCR?智能文件自動化的下一階段

    Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。

  13. LlamaIndex:產品、工程與評測31

    LlamaParse 表格 OCR:如何從文件提取結構化資料

    表格 OCR 透過表格偵測、結構辨識與資料擷取,將文件中的表格轉為 JSON、CSV 或 Excel 等機器可讀格式。LlamaParse 的發票示例會重建行列及欄位關係,並把數值映射至指定 schema。算術、資料類型及跨欄位一致性檢查,有助避免結構錯配流入企業工作流程。

  14. HuggingFace Daily Papers(社區熱門論文)39

    DiffGate:面向同策略蒸餾的難度門控教師指導

    DiffGate 提出結果門控目標,將 GRPO 與按羣組難度調整的有界教師指導結合,只對失敗軌跡施加教師監督。在 Qwen3-0.6B 和 Qwen3-1.7B 上,程式碼 avg@8 較對應的 GRPO 分別提升 +1.7、+1.8 分,pass@8 提升 +1.6、+5.7 分;數學 pass@8 則提升 +1.1、+3.9 分,avg@8 與 GRPO 相差不超過 0.5 分。

  15. HuggingFace Daily Papers(社區熱門論文)23

    大型語言模型的數值線性代數

    這篇綜述以大型語言模型為重點,梳理其所涉及的數值線性代數方法。機器學習中的許多工具,尤其是大型語言模型,均以矩陣和張量方法為基礎。文章旨在向數值方法專家闡明大型語言模型的核心概念,檢視相關技術採用的數值線性代數概念,並指出數值線性代數近期對機器學習的重要貢獻。

  16. HuggingFace Daily Papers(社區熱門論文)39

    為漂移模型學習判別性幾何結構

    研究提出持續表徵學習,讓漂移模型直接從像素學習有效的判別性表徵,無需預訓練編碼器。在多個數據集上,該方法令原有像素空間漂移模型的 FID 降低約 82-95%。調整預訓練表徵及採用速度裁剪可進一步提升效果。

  17. HuggingFace Daily Papers(社區熱門論文)41

    Magic-W0:面向物理智能的結構化世界—動作基礎模型

    Magic-W0 是面向物理智能的世界動作基礎模型,聯合建模結構化物理狀態演變與連續動作,並以當前狀態、轉換及未來狀態表示互動。在 RoboDojo-Sim 上,Magic-W0 平均得分為 27.10,在受比較的世界動作模型中最高。在多項真實機械人任務中,模型以有限下游數據微調後仍展現良好表現,支持其泛化及快速適應能力。

  18. HuggingFace Daily Papers(社區熱門論文)35

    DistScene:以物件至場景蒸餾生成 3D 場景

    DistScene 提出單張圖片組合式 3D 場景生成框架,聯合建模環境與個別物件。框架透過 Object-to-Scene Distillation,以自動組合及渲染的合成場景,把預訓練物件生成先驗轉移至場景生成。在室內及室外基準測試中,DistScene 的場景層級空間連貫性優於參與比較的基線方法。

  19. IT之家48

    特斯拉持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地,進一步優化道路測試計劃

    特斯拉正持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地的申請,並按首輪技術審查意見進一步優化道路測試計劃架構。測試路線除涵蓋法規要求場景,亦將納入由城市至鄉村的多種交通環境,以驗證系統對當地機動車與摩托車混行及交通規則的適應能力。公司將完善路線與場景規劃,推進系統取得相關審核認可。

  20. IT之家64

    Black Forest Labs 發佈 FLUX 3 Image,支援最高 4K 生成及精確排布畫面元素

    Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。

  21. IT之家51

    湖北擴大智能家居國補範圍,機械人、數碼相機等可補貼 15%

    湖北省自 2026 年 10 月 1 日起擴大智能家居及相關消費品補貼範圍,新增機械人、數碼相機、無人機、血壓儀等品類。個人消費者在參與商家購買補貼範圍內產品,可按扣除各環節優惠後的最終售價獲 15% 補貼,每類產品限 1 件、每件不超過 1500 元。數碼及智能產品、家電仍參與國補。