LlamaIndex 2025-03-11 電子報:LlamaParse 開放註冊並宣佈 $19M A 輪融資
LlamaIndex 宣佈 LlamaParse 開放所有人註冊,並公佈 $19M A 輪融資。Parse With Agent 模式現支援 Claude Sonnet 3.7 和 Gemini 2.0 Flash,以改善表格解析及跨頁一致性。電子報亦列出 HuggingFace 的智能體課程,以及 DeepLearning.AI 合作推出的智能體文件工作流程課程。
LlamaIndex 宣佈 LlamaParse 開放所有人註冊,並公佈 $19M A 輪融資。Parse With Agent 模式現支援 Claude Sonnet 3.7 和 Gemini 2.0 Flash,以改善表格解析及跨頁一致性。電子報亦列出 HuggingFace 的智能體課程,以及 DeepLearning.AI 合作推出的智能體文件工作流程課程。
LlamaIndex 電子報彙整本週產品與社羣更新,涵蓋 Llama4 深度研究方案、金融研究智能體教程,以及 Gemini 2.5 Flash 和 GPT-4.1 支援。開源專案 LlamaResearcher 會拆分查詢、搜尋網絡並撰寫文章;Gemini 2.5 Flash 整合無需升級,GPT-4.1 則已獲 API Day 0 支援。
Solace 平台現已全面整合至 LlamaDeploy,並可作為智能體間非同步事件分發的事件訊息代理。LlamaDeploy 原有選項包括 Kafka、Redis、Rocket MQ,現亦支援 Solace。兩者結合可在 10 分鐘內建立適用於 AI 的事件網格;Solace 亦提供免費及付費方案。
LlamaIndex 的 2025-05-06 電子報分享智能體建置、多語言多模態 RAG、文件處理及部署框架的更新。內容包括開源 PapersChat、支援 Solace message broker 的 LlamaDeploy,以及 Ollama 在 LlamaIndex 中支援 Qwen 3。
LlamaIndex 為 LlamaExtract 新增可選的欄位引用與推理資訊,提供抽取內容在來源文件中的位置,以及抽取智能體給出該欄位的理由。使用者可透過 LlamaParse UI 或開源 SDK 配置該功能,並定義預設或自訂 schema。
LlamaIndex 為 LlamaParse 發佈 2025 年 5 月更新,新增 OpenAI GPT 4.1、Google Gemini 2.5 Pro 支援及頁面方向與歪斜自動校正。
LlamaIndex 推出改進版 Memory 組件,讓智能體保留對話歷史並支援長短期記憶。基礎記憶會在 token 限制內把聊天訊息存入 SQL 資料庫,預設使用記憶體內的 SQLite;達到上限後,舊訊息可按設定丟棄或轉存至長期記憶。長期記憶提供靜態資訊、對話事實提取和向量檢索三類區塊,亦可透過擴展 BaseMemoryBlock 自訂記憶區塊。
LlamaIndex 電子報彙整本週的新整合、平台更新,以及參與 Databricks Data + AI Summit 的心得。CleanlabAI 可為每個 LLM 回應評分信任度,並即時捕捉幻覺或錯誤回應;LlamaParse 則推出針對特定用途的解析代理,並更新穩定性。
LlamaIndex 正式發佈 Workflows 1.0,這是供 Python 和 TypeScript 構建複雜多步驟 AI 智能體應用的輕量級框架。
LlamaIndex 本期通訊彙整多項產品與工程更新,包括 Gemini Live 的 TypeScript、Python 語音整合,以及 LlamaParse Indexes 上線託管嵌入向量功能,毋須自備 API key,並提供 10,000 個免費 credits。
StackAI 將 LlamaParse API 整合至智能體開發平台,作為文件匯入核心步驟,為企業文件智能體提供高準確度檢索。LlamaParse 已為企業客户處理超過 1 million 份文件,支援保險、金融及法律領域的知識庫。採用後,StackAI 的下游智能體準確度提升,尤其針對掃描及低質素文件,文件預處理的開發工作亦有所減少。
LlamaIndex 本期電子報慶祝 LlamaParse 一週年,並介紹 SemTools 更新、文件處理指南及即將舉行的 Fullstack Agents Hackathon。SemTools 新增 workspace,使用 LanceDB 快取嵌入向量,使 1000 papers 的搜尋時間由數分鐘縮至數秒,並支援 npm 安裝。Hackathon 設有 $20k 獎金。
LlamaIndex 電子報匯整產品與工程更新,涵蓋 llamactl、Workflow Debugger 及 Text-to-SQL 工作流。llamactl 可在本機開發及執行 LlamaAgents;Workflow Debugger 可即時檢視事件記錄、比較執行結果並監察工作流。
LlamaIndex 為文件推出原生 MCP 搜尋,讓編碼智能體和智能體工作流可直接搜尋全部文件。服務網址為 https://developers.llamaindex.ai/mcp,提供 search_docs(BM25 詞彙搜尋)、grep_docs(正則搜尋)及 read_doc(讀取指定頁面的完整內容)三種工具。BM25 索引在建置時靜態生成,準確度略低於向量搜尋,但維護較輕量。
LlamaIndex 本期電子報宣佈,LlamaClassify TypeScript SDK 現已提供,文件亦整合原生 MCP 搜尋。該搜尋讓編碼智能體可直接使用詞彙搜尋、regex 搜尋及完整頁面內容;另有以 Claude Code 和 vibe-llama 建立金融文件分類智能體工作流程並部署至雲端的示範。
LlamaIndex 開放 LlamaAgents 預覽,結合 LlamaParse 文件處理能力與 Agent Workflows 編排,供開發者構建文件智能體。
LlamaIndex 宣佈推出 LlamaSheets,這款 LlamaParse API 以免費 Beta 提供,可將複雜試算表自動整理為 AI 可用的結構化資料。
LlamaExtract 新增 PER_TABLE_ROW 抽取目標,按文件中的重複實體逐項抽取,並返回 JSON 物件列表。案例中,該功能從醫院 PDF 抽出 380 間醫院,PER_DOC 最多抽取 40 間;從玩具目錄抽出 153 項產品,而 PER_DOC 取回 18 項。它也可處理有可辨識格式規律的清單和目錄,但每個實體所需資訊須在局部上下文內;同時抽取文件層級資料與實體清單則效果不佳。
LlamaIndex 宣佈 LlamaSplit 公開 Beta,這款 REST API 可按自訂類別自動拆分文件,並將連續同類頁面整理成分段。它會返回每段的準確頁碼範圍和信心分數。不同於將整份文件分類的 LlamaParse Classify,LlamaSplit 用於找出單一文件內各類別的邊界,分段後可供後續抽取或路由至相應工作流。
LlamaIndex 推出 LlamaParse v2,以四級配置取代 v1 的解析模式,並加入版本固定選項。四級為 Fast(1 credit/page)、Cost Effective(3 credits/page)、Agentic(10 credits/page)及 Agentic Plus(45 credits/page)。
LlamaIndex 電子報宣佈 LlamaParse v2,簡化設定並降低最高 50% 成本,另推出可自動分隔文件的 LlamaSplit Beta API。內容亦涵蓋採用虛擬檔案系統隔離的 Claude 安全編碼智能體、由 Gemini 3 Flash 驅動的檔案系統探索智能體,以及擴展支援 OpenAI Codex 的 AgentFS 整合。
LlamaIndex 推出新版 llama-cloud SDK 及 LlamaParse API v2,SDK 支援 Python 和 TypeScript,並將 v2 列為新專案建議路徑。
LlamaIndex 推出 LlamaAgents Builder beta,讓 LlamaParse 使用者以自然語言描述文件處理需求,生成可部署的智能體工作流。
LlamaIndex 本期電子報彙整產品、競賽與合作更新,包括 LlamaExtract 新增引用邊界框、推出 LobsterX,以及 Skills 與 MCP 工具選用指南。
LlamaExtract 的 Page-Level Extraction 按頁抽取結構化資料,讓每項結果都能對應至來源頁面。它以自訂 schema 維持整份文件的抽取一致性,並提供 bounding boxes 和 citations,方便核查數據及追溯原文位置。
LlamaIndex 本期電子報公佈多項產品更新,並表示 LlamaCloud 將在未來幾週逐步更名為 LlamaParse。LlamaAgents Builder 新增檔案上傳,LlamaExtract 加入附有邊界框的頁面級引用;電子報分析指出,GPT-5.2 較高推理等級會損害文件解析表現並大幅增加成本與延遲,而 LlamaParse Agentic 的成本低 18 倍。
LlamaIndex 本期電子報介紹其由 RAG 框架發展為智能體文件處理平台,並聚焦 LlamaParse、耐久工作流程及文件解析工具更新。平台服務 300k+ 用户、支援 50+ 格式;DBOS 整合提供自動步驟持久化與崩潰復原,另有簡報搜尋及 PDF 圖表解析工具。
LlamaIndex 開源 LiteParse,這款 CLI 和 TS 原生程式庫可在本機解析 PDF、Office 文件及圖片,為 AI 智能體抽取保留版面關係的文字,且不依賴 Python。
LlamaIndex 推出開源 LiteParse,這是一款基於多年 LlamaParse 開發經驗打造的輕量本機文件解析器。LiteParse 支援版面保留、本機 OCR 及多模態 LLM,並可透過 `npm i -g @llamaindex/liteparse` 安裝。
LlamaParse 更新了 Word(.docx)文件的表格解析方式,改為直接從 Word XML 擷取表格內容並保留原始結構。其專有技術會將 Word XML 表格元素對應至渲染結果中的正確頁面位置,並把 XML 表格內容轉換為 Markdown;這項更新目前適用於 .docx 表格。
LlamaIndex 本期電子報宣佈推出 LiteSearch 本地文件檢索系統,並聚焦文件解析能力更新。LiteSearch 以 LiteParse 建構檢索流程,涵蓋解析、分塊、嵌入向量與向量儲存,無需外部依賴;電子報亦介紹 .docx 表格頁面定位改進,以及整合 Gemini 3.1 Live API 的語音助理示範。
LlamaIndex 發佈 ParseBench,這是一項面向 AI 智能體的文件解析基準,包含約 2,000 頁人工核驗的企業文件和超過 167,000 條測試規則。它從表格、圖表、內容忠實度、語義格式及視覺定位五個維度評估 14 種方法;LlamaParse Agentic 整體得分為 84.9%,是五個關鍵維度均具競爭力的唯一受測方法。基準資料集、評估程式碼和完整研究論文均已公開。
LlamaIndex 與 Kaggle 推出 ParseBench 文件 OCR 排行榜,讓從業者比較解析器、視覺語言模型和文件智能體在企業文件抽取任務上的表現。
LlamaIndex 重構 LlamaParse Platform MCP,將重心由儲存與檢索轉向由 Parse、Classify 和 Split 服務支援的文件處理。
LlamaIndex 推出 LiteParse Server,將 LiteParse 封裝為可自託管的 HTTP API,供不同語言或服務作為文件解析後端。它支援 PDF、Office 文件和圖片,提供帶有文字位置與邊界框的解析結果,並設有 /parse 和 /screenshots 兩個端點。
LlamaIndex 發佈 LiteParse v2.0,提供 Rust、Node、Python 和 WASM 套件,可在瀏覽器及 edge runtimes 執行。
LlamaIndex 宣佈 LlamaParse 推出精細邊界框功能,可按行、字詞及表格儲存格標示文件位置。只有頁面上明確存在的文字會獲分配座標,推斷值、AI 摘要及重建內容則不會有邊界框。功能現以 beta 形式向所有付費方案提供,建立解析任務時須以單一參數選擇啟用;Agentic Plus 會額外執行驗證輪次以提升精度。
LlamaIndex 推出 LiteParse v2.1,新增以啟發式規則實現的無模型 PDF 轉 Markdown 管線。文章稱它在 3 項基準中領先同類無模型開源工具;文首列出的分數為 opendataloader-bench 0.875、olmOCR-bench 0.391、ParseBench 0.3279,後文表格則分別列出 0.871、39.2% 和 0.328。
LlamaIndex 擴展 LlamaParse MCP,加入 Extract 服務整合、Index v2 的智能體知識存取,以及按產品劃分的專用 MCP 端點。
LlamaIndex 在 LlamaParse Index 中加入 Retrieval Harness,並將該功能及其他更新以 Beta 形式開放予所有付費方案。