LlamaIndex 介紹多模態 RAG 的文字與圖片索引、檢索能力
LlamaIndex 介紹多模態 RAG 新抽象,讓文字與圖片可納入索引、檢索及回答流程。新能力包括 OpenAIMultiModal 支援 GPT-4V、ReplicateMultiModal 支援開源多模態模型(目前處於 beta),以及透過 CLIP 建立圖片嵌入。
LlamaIndex 介紹多模態 RAG 新抽象,讓文字與圖片可納入索引、檢索及回答流程。新能力包括 OpenAIMultiModal 支援 GPT-4V、ReplicateMultiModal 支援開源多模態模型(目前處於 beta),以及透過 CLIP 建立圖片嵌入。
LlamaIndex 在 2023–11–14 週報中整理了 OpenAI Dev day 後續的功能更新、示例與指南。更新包括用於文件與圖像問答的多模態 RAG、chat.llamaindex.ai 的實驗性 GPT-4-vision 支援,以及連接 OpenAI Assistants API 與向量資料庫的抽象層。
LlamaIndex 發佈 0.9,新增用於資料匯入與轉換的 IngestionPipeline,並支援快取各轉換步驟。版本亦簡化節點解析與文字切分介面,將 LangChain 改為選裝套件,並將全域 tokenizer 改為可配置,預設採用 CL100K。此外,多模態 RAG 模組以 beta 形式推出,涵蓋多模態 LLM、嵌入及檢索。
LlamaIndex 推出 RAGs,一款 Streamlit 應用,讓用户以自然語言建立並自訂基於自有資料的 RAG pipeline。用户可檢視和調整 builder agent 生成的設定,包括 top-k、chunk size、Embed Model、LLM 及摘要選項,並使用生成的 RAG agent 查詢資料。
LlamaIndex 推出 Llama Packs,這是一個由社羣推動的預包裝模組中心,旨在幫助使用者快速開始建立 LLM 應用。首批已與合作夥伴推出 16+ 個模板,可在 LlamaHub(https://llamahub.ai/)瀏覽,涵蓋 Streamlit 應用、Weaviate 檢索等用途。
LlamaIndex 推出 Llama Datasets,首批提供 10 個社羣貢獻的資料集,用於按不同用例評測 RAG 流程。每個資料集包含問答對及來源上下文,可從 LlamaHub 下載,並使用 RagEvaluatorPack 計算評測指標。開發者亦可手動或以合成方式建立資料集,並向 LlamaHub 和 llama-datasets 提交貢獻。
LlamaIndex 推出 AutoTranslateDoc 命令列工具,可從 GitHub 儲存庫擷取 .md 和 .mdx 文件,並使用 GPT-3.5、GPT-4 分段翻譯。
LlamaIndex 在 2023–12–12 電子報中介紹多項產品更新,涵蓋 RAG 評測、資料管線、多模態功能及開發模板。
LlamaIndex 推出 Query Pipelines 宣告式 API,讓開發者將 LlamaIndex 模組編排成順序鏈或 DAG 查詢工作流。它面向 RAG、結構化資料擷取等用途,支援跨整個流程的 callback,並可減少手動銜接模組所需的樣板程式。目前可組合 LLM、提示詞、查詢引擎、檢索器等模組,也能加入自訂元件;序列化與快取則列為未來方向。
LlamaIndex 推出命令列工具 `llamaindex-cli`,讓使用者無需編寫程式即可將本地文件匯入並透過 RAG 提問。工具隨 `pip install llama-index` 安裝,底層使用 Chroma,另需安裝 `chromadb`;預設使用 OpenAI API,使用前須設定 `OPENAI_API_KEY`。
RAGArch 是 LlamaIndex 驅動的無程式碼工具,可配置及測試 RAG 流水線,並一鍵生成相應 Python 程式碼。它以 Streamlit 提供互動介面,支援設定 LLM、Embedding 模型、節點解析器、回應合成方法及向量儲存庫,並用自有資料即時測試。可選服務包括 OpenAI GPT-3.5、GPT-4、Gemini Pro 及 Cohere API,另提供免費和付費方案。
LlamaIndex 發佈 v0.10.0,將核心功能與整合、模板拆分為獨立套件,並棄用 ServiceContext。新設的 `llama-index-core` 收納核心抽象,數百項整合和模板改為獨立套件,同時保留 `llama_index` 命名空間匯入;使用者可直接傳入參數,或透過全域 `Settings` 設定。
LlamaIndex 宣佈推出 LlamaParse 文件解析服務,並介紹面向大語言模型及 RAG 應用的託管資料導入與檢索 API。解析器針對含表格、圖表等嵌入物件的複雜 PDF,可輸出保留語義結構的 Markdown,並接入 LlamaIndex 的資料導入與檢索流程。公開預覽目前支援 PDF,每日用量上限為 1k 頁;託管 API 則以私有預覽方式開放予有限的企業設計合作夥伴。
LlamaIndex 推出 llama-index-networks 擴充套件,讓多個建基於外部資料來源的 RAG 組成可供查詢的網絡。資料供應方可用 ContributorService 暴露 QueryEngine,查詢方則用 NetworkQueryEngine 連接多個服務;每次查詢會送往所有 contributors,再綜合回應。
LlamaIndex 宣佈推出全球首個 GenAI 原生文件解析平台 LlamaParse,並新增由 GenAI 驅動的解析指令,讓使用者以自然語言指定文件解析方式。
Langfuse 宣佈與 LlamaIndex 推出一鍵整合,讓 RAG 應用可在 Langfuse 中查看追蹤資料。
LlamaIndex 與開源 LLM 評測框架 UpTrain 整合,讓開發者可評估 RAG 管線並試驗不同配置。UpTrain 提供 20+ 預設檢查,評估與分析均在本地執行(LLM 呼叫除外);其 Callback Handler 可檢查生成回覆、RAG 擷取的上下文及中間步驟。
LlamaIndex 提供 Azure Code Interpreter 工具,讓智能體透過 Azure Container Apps dynamic sessions 沙箱執行 LLM 生成的程式碼。文章示範如何設定工具並接入 ReActAgent,讓智能體查詢西雅圖當前時間,以及讀取、排序和下載 CSV 檔案。
LlamaIndex 推出 Property Graph Index,以標記屬性圖表示擴展知識圖譜的建模、儲存與查詢能力。它支援 schema 引導、隱式及自由形式抽取,並可組合關鍵詞/同義詞、向量相似度、Cypher 查詢與自訂圖遍歷。圖譜節點預設會生成嵌入向量,底層儲存支援記憶體、磁碟及 Neo4j。
LlamaIndex 發佈開源框架 llama-agents 的 alpha 版本,旨在簡化多智能體 AI 系統的構建、迭代與部署,並將智能體轉為生產環境微服務。
LlamaIndex 已向用户廣泛提供 LlamaParse,面向企業級 LLM 和 RAG 應用,支援複雜文件解析、資料接入與檢索。它支援 50+ 種語言和 100+ 種文件格式,檢索可配置 hybrid search、reranking 和 metadata filtering。LlamaParse Playground 可在部署前測試和調整資料接入及檢索策略。
Arize AI 與 LlamaIndex 推出 LlamaTrace,這是一個原生支援 LlamaIndex 與 Arize 生態系的大語言模型追蹤及可觀測性託管平台。
LlamaIndex 宣佈推出 LlamaExtract Beta,這項託管服務可從非結構化文件推斷 schema,並按指定 schema 抽取結構化資料。用户可修改推斷出的 schema,或自行定義 schema;已有 schema 時,服務會逐份文件進行抽取。服務提供 UI 和 API,schema 推斷目前最多處理 5 個文件、每份最多 10 頁。
LlamaParse 推出文件級檢索 API,讓系統按問題需求取得整份文件內容,而不只檢索相關區塊。文件級檢索可按元資料或文件內容選擇文件,並支援調整 top-k 結果及按元資料篩選。配套 Jupyter notebook 示範讓智能體按問題在文件級與區塊級檢索間選擇。
LlamaIndex 推出 workflows beta,讓複雜 AI 應用可透過事件驅動架構編排。工作流由 Python 函數步驟組成,步驟可用事件觸發迴圈、自我修正,並透過 Context 分享執行期間的狀態。功能亦支援非同步與 streaming,並提供可觀測性、工作流視覺化和逐步執行除錯。
LlamaIndex 發佈 Python 版 0.11,新增以事件驅動架構構建生成式 AI 應用的 Workflows,以及 Instrumentation 功能。
LlamaIndex 發佈 llama-deploy,讓以 LlamaIndex Workflows 建立的智能體工作流可透過微服務部署及擴展。系統由訊息佇列、控制平面、協調器及工作流服務組成,並支援服務獨立擴展、重試和故障處理。
LlamaIndex 宣佈在企業級 RAG 平台 LlamaParse 推出多模態功能,讓開發者可在數分鐘內建立同時索引及檢索文字與圖像的 RAG 管線。啟用 Multi-Modal Indexing 後,系統會把頁面截圖與提取文字一併建立索引,並可透過 API 接入應用程式。
LlamaIndex 推出 LlamaParse Premium,結合多模態模型與啟發式文本解析,處理複雜文件中的文本、表格和視覺內容。輸出可將文字、表格和圖像整理為結構化 Markdown,並把圖表轉成 Mermaid、公式輸出為 LaTeX,為所有圖像加上説明。
LlamaIndex 已整合 MistralAI 的 Pixtral 12B,提升圖表分析、圖像理解及圖像轉程式碼能力。本期亦提供以 OpenAI o1 和 LlamaParse 處理多工作表 Excel 的進階 RAG 指南,以及使用 LlamaParse 建立市場研究報告多模態 RAG 流程的教學。
LlamaIndex 本週推出 Mistral-3B 和 Mistral-8B 的 day-0 整合,並分享以 LlamaParse 從 ArXiv 論文知識庫生成綜述報告的遞迴式智能體工作流程。另有動態 few-shot prompting 專案,按查詢檢索相關示例以改善客户支援和 text-to-SQL,並列出多項 RAG、智能體應用案例及招聘職位。
RAGformation 是一款開源 AI 工具,可根據用户的自然語言需求,自動選擇雲端服務、設計架構並估算價格。它運用 RAG 與 Llama Index Workflows 生成架構流程圖,並按需求調整推薦服務和配置。用户確認方案後,工具會生成包含流程圖、定價及所選服務摘要的報告,程式碼可在 GitHub 取得。
LlamaParse 的 Auto Mode 以標準模式解析文件,並按頁面條件切換至 Premium 模式,以降低高階解析成本。觸發條件包括表格、圖片、指定文字及正則表達式,讓 Premium 解析只套用於符合條件的頁面。文章示範的能力包括將圖表轉成 Markdown 表格、渲染 Mermaid 圖表,以及提升表格讀取準確度。
LlamaIndex 推出文件智能體工作流程教學系列,涵蓋法律文件、發票及患者病例摘要。LlamaParse 新增可遵守 SharePoint 權限的 RAG 智能體內置支援,並可整合 Azure 企業資料來源、維持文件層級存取控制。LlamaIndex 亦為 Google 最新 Gemini 2.0 模型提供 day-0 支援。
LlamaReport 開放 beta,供部分早期用户將文件轉化為結構化報告。這款 API 優先工具支援上載來源文件與範本、規劃報告生成,並以 LLM 編輯報告;範本可採用 Markdown、提示詞或問卷。產品提供免費及付費方案,API 和 UI 預計於 early Q1 一般開放。
LlamaIndex 推出 LlamaReport 預覽版,可將文件資料庫轉為可自訂報告;LlamaParse 新增音訊轉文字功能,並支援處理 PDF 和試算表。LlamaIndex 亦發布智能體文件工作流程 Notebook,示範簡化特定領域業務邏輯、處理汽車保險索償及統一供應商發票單位。
LlamaParse EU 開放早期體驗,這項以歐盟為基地的 SaaS 服務確保處理業務關鍵資料時,資料駐留完全限於歐盟司法管轄範圍內。服務提供免費及付費方案,企業可聯絡團隊申請早期預覽。
LlamaIndex 更新 LlamaParse,將解析模式重新命名為 Fast、Balanced 和 Premium,並提供無 AI、LLM、LVM 與 Agent 四種解析方式。
LlamaIndex 推出 LlamaExtract,讓用户按自訂 schema 從非結構化文件抽取結構化資料,並以 JSON 輸出。LlamaExtract 現向 LlamaParse 用户開放公測,可透過 LlamaParse 網頁介面或 Python SDK 使用;Python SDK 支援可擴展的批次處理。
LlamaIndex 宣佈 LlamaParse 正式開放使用,並完成由 Norwest Venture Partners 領投、Greylock Partners 參與的 $19M A 輪融資,使累計融資達 $27.5M。