跳到正文

全部動態

今日 453 條
10月3日週六
  1. LlamaIndex:產品、工程與評測55

    LlamaIndex 文件推出原生 MCP 搜尋,提供三種工具

    LlamaIndex 為文件推出原生 MCP 搜尋,讓編碼智能體和智能體工作流可直接搜尋全部文件。服務網址為 https://developers.llamaindex.ai/mcp,提供 search_docs(BM25 詞彙搜尋)、grep_docs(正則搜尋)及 read_doc(讀取指定頁面的完整內容)三種工具。BM25 索引在建置時靜態生成,準確度略低於向量搜尋,但維護較輕量。

  2. LlamaIndex:產品、工程與評測42

    LlamaIndex 電子報 2025-11-04

    LlamaIndex 本期電子報宣佈,LlamaClassify TypeScript SDK 現已提供,文件亦整合原生 MCP 搜尋。該搜尋讓編碼智能體可直接使用詞彙搜尋、regex 搜尋及完整頁面內容;另有以 Claude Code 和 vibe-llama 建立金融文件分類智能體工作流程並部署至雲端的示範。

  3. LlamaIndex:產品、工程與評測56

    LlamaIndex 示範如何為智能體文件工作流程建立可觀測性

    LlamaIndex 示範以 Agent Workflows、OpenTelemetry 和 Jaeger,為財務文件分類及資料抽取流程建立可觀測性。範例用 LlamaClassify 將文件分類為損益表、現金流量表或資產負債表,再按類型以 LlamaExtract 擷取結構化資料;Jaeger 可查看一條 trace 中收集的五個 spans 和各步耗時。

  4. LlamaIndex:產品、工程與評測26

    AI 文件解析:LLM 正重塑機器讀取與理解文件的方式

    LLM 正重塑 AI 文件解析,讓機器能從文字與圖像理解文件版面、語義及上下文。相較 OCR、NLP、NER 等依賴模板與規則的工具,多模態 LLM 可重建語義閲讀順序、理解圖表與表格,並處理新文件類型而毋須重新訓練。但單靠標準 LLM API 解析複雜版面,仍可能漏掉細節或產生幻覺數值。

  5. LlamaIndex:產品、工程與評測52

    從文件中抽取重複實體:使用 LlamaExtract 進行表格行抽取

    LlamaExtract 新增 PER_TABLE_ROW 抽取目標,按文件中的重複實體逐項抽取,並返回 JSON 物件列表。案例中,該功能從醫院 PDF 抽出 380 間醫院,PER_DOC 最多抽取 40 間;從玩具目錄抽出 153 項產品,而 PER_DOC 取回 18 項。它也可處理有可辨識格式規律的清單和目錄,但每個實體所需資訊須在局部上下文內;同時抽取文件層級資料與實體清單則效果不佳。

  6. LlamaIndex:產品、工程與評測45

    OlmOCR-Bench 評析:OCR 基準測試的洞見與陷阱

    LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。

  7. LlamaIndex:產品、工程與評測51

    LlamaIndex 宣佈 LlamaSplit 公開 Beta,按自訂類別拆分長文件

    LlamaIndex 宣佈 LlamaSplit 公開 Beta,這款 REST API 可按自訂類別自動拆分文件,並將連續同類頁面整理成分段。它會返回每段的準確頁碼範圍和信心分數。不同於將整份文件分類的 LlamaParse Classify,LlamaSplit 用於找出單一文件內各類別的邊界,分段後可供後續抽取或路由至相應工作流。

  8. LlamaIndex:產品、工程與評測45

    LlamaIndex 電子報:2025-12-23

    LlamaIndex 電子報宣佈 LlamaParse v2,簡化設定並降低最高 50% 成本,另推出可自動分隔文件的 LlamaSplit Beta API。內容亦涵蓋採用虛擬檔案系統隔離的 Claude 安全編碼智能體、由 Gemini 3 Flash 驅動的檔案系統探索智能體,以及擴展支援 OpenAI Codex 的 AgentFS 整合。

  9. LlamaIndex:產品、工程與評測53

    LlamaIndex 指出檔案系統正成為智能體管理上下文的核心介面

    LlamaIndex 指出,智能體正以檔案及檔案系統管理長期對話、檢索外部上下文和載入技能,並將其視為重要的上下文介面。作者稱,實驗中配備檔案系統工具和語義搜尋的推理智能體可動態檢索上下文,而單靠檔案搜尋在中小型文件集合上亦勝過 naive semantic search(不計延遲)。

  10. LlamaIndex:產品、工程與評測53

    智能體何時該用技能、何時該用 MCP 工具?LlamaIndex 比較兩者適用情境

    LlamaIndex 比較了智能體使用技能與 MCP 工具的取捨,指出 MCP 適合輸入輸出明確、要求可預測執行的操作,技能則適合以自然語言提供行為指引。MCP 以固定 schema 的 API 呼叫執行,但通常需要一定開發知識並帶來網絡延遲;技能以本地檔案提供指示,設定較輕,卻可能因 LLM 解讀而產生誤判或幻覺。

  11. LlamaIndex:產品、工程與評測37

    LlamaIndex 電子報 2026-02-24:多項產品更新及 LlamaCloud 將更名為 LlamaParse

    LlamaIndex 本期電子報公佈多項產品更新,並表示 LlamaCloud 將在未來幾週逐步更名為 LlamaParse。LlamaAgents Builder 新增檔案上傳,LlamaExtract 加入附有邊界框的頁面級引用;電子報分析指出,GPT-5.2 較高推理等級會損害文件解析表現並大幅增加成本與延遲,而 LlamaParse Agentic 的成本低 18 倍。

  12. LlamaIndex:產品、工程與評測38

    LlamaIndex 2026-03-10 電子報

    LlamaIndex 本期電子報介紹其由 RAG 框架發展為智能體文件處理平台,並聚焦 LlamaParse、耐久工作流程及文件解析工具更新。平台服務 300k+ 用户、支援 50+ 格式;DBOS 整合提供自動步驟持久化與崩潰復原,另有簡報搜尋及 PDF 圖表解析工具。

  13. LlamaIndex:產品、工程與評測47

    解析難以辨讀的文件:LlamaParse 如何處理訴訟證據開示文件

    LlamaParse 以多模態模型解析法律證據開示文件,可處理低畫質掃描件,並理解頁面版面、圖片、圖表及表格。它支援自訂解析指示,API 可回傳「markdown」、「text」及「items」等輸出。文章建議這類文件使用 `tier="agentic_plus"`,該層級針對複雜版面與視覺內容優化;所有 tier 均採用高解析度 OCR。

  14. LlamaIndex:產品、工程與評測48

    LlamaParse 改善 Word(.docx)文件的表格解析

    LlamaParse 更新了 Word(.docx)文件的表格解析方式,改為直接從 Word XML 擷取表格內容並保留原始結構。其專有技術會將 Word XML 表格元素對應至渲染結果中的正確頁面位置,並把 XML 表格內容轉換為 Markdown;這項更新目前適用於 .docx 表格。

  15. LlamaIndex:產品、工程與評測37

    LlamaIndex 2026-03-31 電子報:推出 LiteSearch 並更新文件解析能力

    LlamaIndex 本期電子報宣佈推出 LiteSearch 本地文件檢索系統,並聚焦文件解析能力更新。LiteSearch 以 LiteParse 建構檢索流程,涵蓋解析、分塊、嵌入向量與向量儲存,無需外部依賴;電子報亦介紹 .docx 表格頁面定位改進,以及整合 Gemini 3.1 Live API 的語音助理示範。

  16. LlamaIndex:產品、工程與評測45

    LlamaIndex:圖表數據提取逐步指南

    圖表數據提取須將圖中的視覺標記映射為座標數值,再整理成結構化資料;流程包括識別圖表類型、解析座標軸與圖例、定位數據點及匯出。人工數位化通常每張圖需 15 至 30 分鐘,傳統 OCR 只能辨識文字;AI/VLM(如 LlamaParse)可處理多種圖表,並輸出 CSV、JSON 或 Markdown,附信心分數與引用。

  17. LlamaIndex:產品、工程與評測29

    法律文件 OCR:準確度與合規要求

    法律文件 OCR 的結構錯誤與字符誤讀會妨礙 eDiscovery 搜尋、合約審查及合規記錄,並帶來法律風險。複雜版面下,傳統 OCR 的字符錯誤率為 3–8%;準確率達 98% 時,處理 50,000 頁仍有 1,000 頁出錯。文章探討智能體方法如何縮小差距,以及評估法律工作流程 OCR 軟件時應關注的因素。

  18. LlamaIndex:產品、工程與評測30

    建構 OCR 流程:提升效率的步驟

    要構建可靠的 OCR 流程,須整合文件輸入、影像預處理、文字檢測與識別、版面解析及驗證,將掃描件、PDF 和圖片轉為可供後續系統使用的結構化資料。文件格式、影像品質及表格與多欄版面各異,單靠字元識別容易遺失欄位、表格與文件區段之間的關係,各處理階段須協同運作以確保輸出可靠。

  19. LlamaIndex:產品、工程與評測26

    2026 年面向全球文件辨識的最佳多語言 OCR 軟件

    2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。

  20. LlamaIndex:產品、工程與評測51

    LlamaIndex 發佈首個面向 AI 智能體的文件解析基準 ParseBench

    LlamaIndex 發佈 ParseBench,這是一項面向 AI 智能體的文件解析基準,包含約 2,000 頁人工核驗的企業文件和超過 167,000 條測試規則。它從表格、圖表、內容忠實度、語義格式及視覺定位五個維度評估 14 種方法;LlamaParse Agentic 整體得分為 84.9%,是五個關鍵維度均具競爭力的唯一受測方法。基準資料集、評估程式碼和完整研究論文均已公開。

  21. LlamaIndex:產品、工程與評測34

    PDF 字元辨識:OCR 如何運作及在哪些情況下失效

    OCR 透過辨識掃描 PDF 中的像素字形,將影像文字轉成可搜尋、可選取的機器可讀文字。輸出可保留掃描影像並加入隱藏文字層,亦可用可編輯文字取代掃描影像。遇上多欄排版,閲讀次序可能被打亂;表格亦可能攤平成無結構文字,令辨識結果難以供機器使用。

  22. LlamaIndex:產品、工程與評測38

    金融文件欄位擷取範本:多數流程常犯的錯誤

    可靠的金融文件欄位擷取範本不能只列欄位,還須定義資料型別、結構、預期位置及驗證規則,以免系統因版面差異而靜默輸出錯誤數值。發票與銀行結單應採用分開的模組化結構並共用驗證層;OCR 之外,處理層亦須理解文件版面,否則規則式定位及逐頁擷取可能造成錯值、交易列遺漏或重複。

  23. LlamaIndex:產品、工程與評測48

    LiteParse 如何將 PDF 轉為文字:深入剖析網格投影演算法

    LiteParse 以網格投影演算法將 PDF 文字座標重建為純文字,利用等寬字元網格保留空間排列與對齊結構。演算法按 Y 座標容差將文字片段分行,並抽取左、右及置中錨點,將內容吸附至相應位置。空白壓縮可把 4 個空格的欄距縮為 2 個,以保留 LLM tokens 並維持版面資訊;GridDebugLogger 則可追蹤處理流程中的判斷。