使用 LlamaIndex 與 Memgraph 建構知識圖譜
Memgraph 示範如何透過 LlamaIndex 將非結構化文字建成可用自然語言查詢的知識圖譜。範例以 Charles Darwin 傳記抽取實體與關係,並透過查詢得出 Alfred Russel Wallace 是其合作者。
Memgraph 示範如何透過 LlamaIndex 將非結構化文字建成可用自然語言查詢的知識圖譜。範例以 Charles Darwin 傳記抽取實體與關係,並透過查詢得出 Alfred Russel Wallace 是其合作者。
LlamaParse 的 SharePoint 整合支援權限感知檢索,可將 SharePoint 的細粒度存取控制用於 RAG 應用中的文件存取。建立索引並同步文件後,可在 chunks 預覽查看 allowed_siteUser_ids 等權限欄位。更新 SharePoint 檔案的共享對象並再次同步,chunks 預覽中的允許使用者清單會隨之變更。
LlamaParse 的 Auto Mode 以標準模式解析文件,並按頁面條件切換至 Premium 模式,以降低高階解析成本。觸發條件包括表格、圖片、指定文字及正則表達式,讓 Premium 解析只套用於符合條件的頁面。文章示範的能力包括將圖表轉成 Markdown 表格、渲染 Mermaid 圖表,以及提升表格讀取準確度。
LlamaIndex 推出文件智能體工作流程教學系列,涵蓋法律文件、發票及患者病例摘要。LlamaParse 新增可遵守 SharePoint 權限的 RAG 智能體內置支援,並可整合 Azure 企業資料來源、維持文件層級存取控制。LlamaIndex 亦為 Google 最新 Gemini 2.0 模型提供 day-0 支援。
LlamaReport 開放 beta,供部分早期用户將文件轉化為結構化報告。這款 API 優先工具支援上載來源文件與範本、規劃報告生成,並以 LLM 編輯報告;範本可採用 Markdown、提示詞或問卷。產品提供免費及付費方案,API 和 UI 預計於 early Q1 一般開放。
LlamaIndex 推出 LlamaReport 預覽版,可將文件資料庫轉為可自訂報告;LlamaParse 新增音訊轉文字功能,並支援處理 PDF 和試算表。LlamaIndex 亦發布智能體文件工作流程 Notebook,示範簡化特定領域業務邏輯、處理汽車保險索償及統一供應商發票單位。
LlamaIndex 與 NVIDIA 合作設計並發布 NVIDIA AI Blueprint,提供一套以智能體驅動 RAG 研究、撰寫及修訂網誌文章的多智能體系統。
作者以 LlamaIndex Workflows 實作面向 Neo4j 知識圖譜的 text2cypher 智能體,展示查詢生成、失敗重試、結果評估與迭代規劃流程。
Caidera.ai 採用 LlamaIndex 建構生命科學市場推廣自動化多智能體系統,處理科學資料擷取、內容生成及合規檢查。產品仍處於 beta 階段,早期採用者回報活動建立時間減少 70%、轉換率最高提升 2x、活動開發所需資源減少 40%,合規流程加快 3x。
LlamaParse EU 開放早期體驗,這項以歐盟為基地的 SaaS 服務確保處理業務關鍵資料時,資料駐留完全限於歐盟司法管轄範圍內。服務提供免費及付費方案,企業可聯絡團隊申請早期預覽。
LlamaIndex 更新 LlamaParse,將解析模式重新命名為 Fast、Balanced 和 Premium,並提供無 AI、LLM、LVM 與 Agent 四種解析方式。
LlamaIndex 推出 LlamaExtract,讓用户按自訂 schema 從非結構化文件抽取結構化資料,並以 JSON 輸出。LlamaExtract 現向 LlamaParse 用户開放公測,可透過 LlamaParse 網頁介面或 Python SDK 使用;Python SDK 支援可擴展的批次處理。
LlamaIndex 宣佈 LlamaParse 正式開放使用,並完成由 Norwest Venture Partners 領投、Greylock Partners 參與的 $19M A 輪融資,使累計融資達 $27.5M。
LlamaIndex 宣佈 LlamaParse 開放所有人註冊,並公佈 $19M A 輪融資。Parse With Agent 模式現支援 Claude Sonnet 3.7 和 Gemini 2.0 Flash,以改善表格解析及跨頁一致性。電子報亦列出 HuggingFace 的智能體課程,以及 DeepLearning.AI 合作推出的智能體文件工作流程課程。
LlamaIndex 示範如何用 LlamaParse 解析 PDF,並將文件內容轉成供 LLM 應用使用的結構化資料。Python 範例展示如何輸出 Markdown、解析表格,並啟用 auto mode 擷取圖表;解析設定亦可指定頁碼、排除頁面區域或加入提示詞。提取結果可進一步存入向量資料庫。
LlamaIndex 電子報彙整本週產品與社羣更新,涵蓋 Llama4 深度研究方案、金融研究智能體教程,以及 Gemini 2.5 Flash 和 GPT-4.1 支援。開源專案 LlamaResearcher 會拆分查詢、搜尋網絡並撰寫文章;Gemini 2.5 Flash 整合無需升級,GPT-4.1 則已獲 API Day 0 支援。
LlamaIndex 將 Agentic Document Workflow(ADW)作為企業文件流程的參考架構,以 Parse、Retrieve、Reason、Act 四階段把文件處理連接至業務動作,目標是超越「與文件聊天」原型。
LlamaIndex 主張以 Workflows 設計 AI 智能體,在結構化執行與 LLM 自主決策之間取得平衡。Workflows 是支援 Python 和 TypeScript 的事件式系統,可編排智能體執行,並構建鏈式、分支、循環及扇出流程。文章建議將結構用於關鍵業務邏輯、易出錯操作和結構化輸出,將自主性用於非結構化輸入及新情況。
Solace 平台現已全面整合至 LlamaDeploy,並可作為智能體間非同步事件分發的事件訊息代理。LlamaDeploy 原有選項包括 Kafka、Redis、Rocket MQ,現亦支援 Solace。兩者結合可在 10 分鐘內建立適用於 AI 的事件網格;Solace 亦提供免費及付費方案。
LlamaIndex 的 2025-05-06 電子報分享智能體建置、多語言多模態 RAG、文件處理及部署框架的更新。內容包括開源 PapersChat、支援 Solace message broker 的 LlamaDeploy,以及 Ollama 在 LlamaIndex 中支援 Qwen 3。
LlamaIndex 為 LlamaExtract 新增可選的欄位引用與推理資訊,提供抽取內容在來源文件中的位置,以及抽取智能體給出該欄位的理由。使用者可透過 LlamaParse UI 或開源 SDK 配置該功能,並定義預設或自訂 schema。
LlamaIndex 為 LlamaParse 發佈 2025 年 5 月更新,新增 OpenAI GPT 4.1、Google Gemini 2.5 Pro 支援及頁面方向與歪斜自動校正。
LlamaIndex 推出改進版 Memory 組件,讓智能體保留對話歷史並支援長短期記憶。基礎記憶會在 token 限制內把聊天訊息存入 SQL 資料庫,預設使用記憶體內的 SQLite;達到上限後,舊訊息可按設定丟棄或轉存至長期記憶。長期記憶提供靜態資訊、對話事實提取和向量檢索三類區塊,亦可透過擴展 BaseMemoryBlock 自訂記憶區塊。
LlamaIndex 電子報彙整本週的新整合、平台更新,以及參與 Databricks Data + AI Summit 的心得。CleanlabAI 可為每個 LLM 回應評分信任度,並即時捕捉幻覺或錯誤回應;LlamaParse 則推出針對特定用途的解析代理,並更新穩定性。
MCP 不會取代向量搜尋:聯邦式 MCP 可讓智能體直接查詢結構化資料,但跨來源排序、延遲和供應商搜尋品質仍有限。企業資料中有 90% 是缺乏原生查詢 API 的 PDF、PPT、掃描檔和試算表,仍須經解析、抽取、分塊及索引;集中式檢索層則可快速查找語義相關內容。
LlamaIndex 正式發佈 Workflows 1.0,這是供 Python 和 TypeScript 構建複雜多步驟 AI 智能體應用的輕量級框架。
LlamaIndex 分享 LlamaParse 擴展企業級 RAG 的四項實務要點:多租户負載調度、存取控制、文件解析與故障處理。平台託管調度控制可處理不同用户的負載差異;資料來源連接器會把檔案權限作為 metadata 寫入向量資料庫,供檢索按權限篩選。LlamaParse 保留文件結構、將表格轉為 Markdown 並提取圖片;資料匯入亦須應對第三方 AI 服務的限流、延遲和停機。
LlamaIndex 闡釋上下文工程:為 AI 智能體挑選並整理相關資訊,以填充 LLM 的上下文窗口,而非只設計提示詞或處理 RAG 檢索。上下文可包括系統提示詞、用户輸入、短期及長期記憶、知識庫資料、工具定義與回應、結構化輸出及全局狀態。文章亦討論知識庫或工具的選擇,以及以摘要壓縮和排序,在有限的上下文窗口內保留相關資訊。
DeepEval 與 LlamaIndex 的示例展示如何評估 RAG 流程,檢視生成答案及檢索內容的品質。示例採用 Answer Relevancy、Faithfulness 和 Contextual Precision,分別評估答案相關性、事實忠實度與檢索排序。DeepEval 提供 50+ 預置指標及自訂指標建構器,可依評測分數調整模型、提示詞模板、top-K 設定和嵌入模型。
LLM 正革新企業 PDF 解析,從單純讀取文字轉向理解文件版面與內容;LlamaParse 利用視覺語言模型處理文字和視覺元素,並保留文件結構。平台可處理表格、掃描文件、表單及技術圖紙,並透過 LlamaExtract 輸出 Markdown、JSON、XML 或自訂格式。服務提供免費及付費方案,實施指南涵蓋文件盤點、試點、擴展及正式部署。
Oxylabs 與 LlamaIndex 的整合指南示範如何設定專用讀取器,並構建可透過 Google 搜尋取得即時網頁資料的 AI 智能體。整合提供 Google、Amazon、YouTube 的資料讀取器,也支援一般網站抓取,並可解析 HTML、應對反抓取措施。範例使用 OpenAI 的 gpt-4o-mini,文章指出此方案可降低頻繁網頁搜尋的成本。
LlamaIndex 本期通訊彙整多項產品與工程更新,包括 Gemini Live 的 TypeScript、Python 語音整合,以及 LlamaParse Indexes 上線託管嵌入向量功能,毋須自備 API key,並提供 10,000 個免費 credits。
LlamaIndex 教學示範如何以 LlamaParse Index 配合開源智能體框架,建立可檢索企業文件並回答複雜問題的文件智能體。示例使用 JPMorgan Chase 存款帳户披露文件及利率協議,結合 Claude Sonnet 4、文件查詢工具和計算器,處理透支費用等多步推理任務。
LlamaIndex 教程示範透過 Bright Data 工具為 LlamaIndex 的 AI 智能體接入網頁資料,支援按需取得更新資訊。範例以 `BrightDataToolSpec` 和 `FunctionAgent` 配置工具,展示網頁抓取、搜尋、結構化資料讀取及截圖,並提供完整 Python 程式碼。
StackAI 將 LlamaParse API 整合至智能體開發平台,作為文件匯入核心步驟,為企業文件智能體提供高準確度檢索。LlamaParse 已為企業客户處理超過 1 million 份文件,支援保險、金融及法律領域的知識庫。採用後,StackAI 的下游智能體準確度提升,尤其針對掃描及低質素文件,文件預處理的開發工作亦有所減少。
LlamaIndex 介紹為 Claude Code 加入文件理解能力的三種做法,涵蓋 MCP 文件檢索、CLI 文件操作,以及以 CLAUDE.md 指引工作流建置。
LlamaIndex 本期電子報慶祝 LlamaParse 一週年,並介紹 SemTools 更新、文件處理指南及即將舉行的 Fullstack Agents Hackathon。SemTools 新增 workspace,使用 LanceDB 快取嵌入向量,使 1000 papers 的搜尋時間由數分鐘縮至數秒,並支援 npm 安裝。Hackathon 設有 $20k 獎金。
文件處理中,解析會把文件轉成供 AI 使用、並保留內容、結構與脈絡的格式;擷取則依預設 schema 抽出指定欄位,輸出結構化資料。解析適用於搜尋問答、RAG,以及需要保留文件脈絡的場景;擷取則適用於填入資料庫、處理表單和自動化業務流程。擷取並非取代解析,而是建立在解析之上,須先將文件轉成機器可讀內容,再識別、驗證並整理目標欄位。
LlamaIndex 電子報匯整產品與工程更新,涵蓋 llamactl、Workflow Debugger 及 Text-to-SQL 工作流。llamactl 可在本機開發及執行 LlamaAgents;Workflow Debugger 可即時檢視事件記錄、比較執行結果並監察工作流。
LlamaIndex 解讀 DeepSeek-OCR 將文件圖像作為文字資訊的壓縮表示,並分析其與文件解析、LlamaParse 的關係。文中稱,論文示例把 1,000 個文字 tokens 壓至 100 個視覺 tokens,解碼準確率為 97%;20× 壓縮時準確率約為 60%。文章指出,RAG、文件問答和摘要等理解型用途可考慮視覺壓縮;若需要結構化資料、語義層級或精確文字操作,仍需文件解析。