LlamaIndex 比較 GPT-4 與開源 Prometheus 模型的 RAG 評估表現
LlamaIndex 使用其框架,基於包含 100 條問題的 Llama 2 論文資料集,比較 Prometheus 與 GPT-4 的 RAG 評估表現。GPT-4 的 Faithfulness 和 Relevancy 分數分別為 0.93 和 0.98,Prometheus 則為 0.39 和 0.57;文章亦展示 Prometheus 有時會誤判上下文資訊。
LlamaIndex 使用其框架,基於包含 100 條問題的 Llama 2 論文資料集,比較 Prometheus 與 GPT-4 的 RAG 評估表現。GPT-4 的 Faithfulness 和 Relevancy 分數分別為 0.93 和 0.98,Prometheus 則為 0.39 和 0.57;文章亦展示 Prometheus 有時會誤判上下文資訊。
LlamaIndex 與 OpenLLM 結合,可構建基於自訂語料、能理解並回應查詢的智能查詢回應系統。示例以 OpenLLM 啟動本地 Llama 2 7B 服務,並由 LlamaIndex 管理及檢索私有、特定領域資料。若使用 vLLM 後端,需配備 Ampere 或更新架構的 GPU 及 CUDA 11.8。
LlamaIndex 提供進階 RAG 建構速查表與實作配方,指出系統成效取決於檢索能否找到相關文件,以及生成能否善用文件回答查詢。內容示範以 Chunk-Size Optimization 調整文件分塊,並以結構化外部知識支援遞迴檢索或路由檢索。
LlamaIndex 推出 Query Pipelines 宣告式 API,讓開發者將 LlamaIndex 模組編排成順序鏈或 DAG 查詢工作流。它面向 RAG、結構化資料擷取等用途,支援跨整個流程的 callback,並可減少手動銜接模組所需的樣板程式。目前可組合 LLM、提示詞、查詢引擎、檢索器等模組,也能加入自訂元件;序列化與快取則列為未來方向。
LlamaIndex 與 Activeloop 合作提供免費 Advanced Retrieval Augmented Generation for Production 課程。
LlamaIndex 示範以文件 metadata 標記使用者,並在查詢時透過 metadata filter 限定可檢索的資料,建構多租户 RAG 系統。示例將 Jerry 與 Ravi 的論文分別加入同一索引,使用 ExactMatchFilter 分隔查詢;Jerry 查詢 Ravi 的 LLMCompiler 論文時未檢索到相關內容。
LlamaIndex 的教程示範如何用 LlamaIndex、Qdrant 和 Render 建立並部署 Slack 聊天機械人,讓它從工作區對話記錄資訊並回答相關問題。機械人把未提及它的訊息存入索引,將提及它的訊息作為查詢;Qdrant 用來持久保存記憶,FixedRecencyPostprocessor 配合最多 20 條檢索結果,令較新的訊息優先。
LlamaIndex 與 Zilliz Cloud Pipelines 整合,讓開發者以託管檢索服務構建可擴展的 RAG 應用。示範以 30 行程式碼構建支援 metadata filtering 的多租户 RAG 聊天機械人,並可不改程式碼由一名用户擴展至數百萬名用户。
LlamaIndex 推出命令列工具 `llamaindex-cli`,讓使用者無需編寫程式即可將本地文件匯入並透過 RAG 提問。工具隨 `pip install llama-index` 安裝,底層使用 Chroma,另需安裝 `chromadb`;預設使用 OpenAI API,使用前須設定 `OPENAI_API_KEY`。
LlamaIndex 的技術指南示範如何將 Tonic Validate 接入 LlamaIndex,並透過 pytest 和 GitHub Actions 建立 RAG 整合測試,以追蹤回答品質變化。
LlamaIndex 使用 Retrieval Evaluation module,在 Weaviate 中按查詢類型調校 RAG 混合搜尋的 Alpha,並比較有無重排器的檢索結果。實驗涵蓋六類查詢,以及索引一篇或三篇論文的資料集,並以 Hit Rate 和 MRR 評估檢索表現。文中結果顯示,重排器提升所測資料的兩項指標,而 Alpha 的表現會隨查詢類型和索引文檔數量而異。
RAGArch 是 LlamaIndex 驅動的無程式碼工具,可配置及測試 RAG 流水線,並一鍵生成相應 Python 程式碼。它以 Streamlit 提供互動介面,支援設定 LLM、Embedding 模型、節點解析器、回應合成方法及向量儲存庫,並用自有資料即時測試。可選服務包括 OpenAI GPT-3.5、GPT-4、Gemini Pro 及 Cohere API,另提供免費和付費方案。
LlamaIndex.TS 教程示範如何以 TypeScript 建立 LLM 智能體,讓它調用函數工具完成計算,並根據文件回答問題。文件流程以 VectorStoreIndex 和 SummaryIndex 建立查詢及摘要工具;使用前須執行 `npm install llamaindex` 並設定 `OPENAI_API_KEY`。
LlamaIndex 結合 OpenAI GPT4V 與 LanceDB,示範以多模態 RAG 處理影片,檢索影像及音訊轉寫內容。流程每 5 秒擷取 1 個影格(約 160 個),將音訊轉成文字,再用 OpenAI CLIP 為文字和影像生成嵌入向量,存入 LanceDB VectorStore。
LlamaIndex 宣佈推出 LlamaParse 文件解析服務,並介紹面向大語言模型及 RAG 應用的託管資料導入與檢索 API。解析器針對含表格、圖表等嵌入物件的複雜 PDF,可輸出保留語義結構的 Markdown,並接入 LlamaIndex 的資料導入與檢索流程。公開預覽目前支援 PDF,每日用量上限為 1k 頁;託管 API 則以私有預覽方式開放予有限的企業設計合作夥伴。
LlamaIndex 推出 llama-index-networks 擴充套件,讓多個建基於外部資料來源的 RAG 組成可供查詢的網絡。資料供應方可用 ContributorService 暴露 QueryEngine,查詢方則用 NetworkQueryEngine 連接多個服務;每次查詢會送往所有 contributors,再綜合回應。
LlamaIndex 宣佈推出全球首個 GenAI 原生文件解析平台 LlamaParse,並新增由 GenAI 驅動的解析指令,讓使用者以自然語言指定文件解析方式。
Langfuse 宣佈與 LlamaIndex 推出一鍵整合,讓 RAG 應用可在 Langfuse 中查看追蹤資料。
LlamaIndex 與開源 LLM 評測框架 UpTrain 整合,讓開發者可評估 RAG 管線並試驗不同配置。UpTrain 提供 20+ 預設檢查,評估與分析均在本地執行(LLM 呼叫除外);其 Callback Handler 可檢查生成回覆、RAG 擷取的上下文及中間步驟。
LlamaIndex 示範以差分隱私將敏感資料轉成合成資料,再透過 NetworkRetriever 讓多個貢獻者跨網絡檢索。在包含 1,200 個樣本、24 種疾病標籤的 Symptom2Disease 示例中,NetworkRetriever 的 hit rate 和 mean reciprocal rank 高於單一貢獻者檢索器。
Protect AI 示範將 LLM Guard 整合至 LlamaIndex 建構的 RAG 應用,掃描輸入文件與模型輸出中的惡意內容。示例以藏於候選人履歷白字中的提示詞注入作測試,並為簡化流程在檢索階段掃描文件。文中指出文件理想上應在匯入前掃描,並需檢查從 API 即時檢索的資料。
Mozilla 的客座文章示範使用 llamafile 在本機執行大語言模型,並配合 LlamaIndex 建立本機 RAG 研究助理。示例以同一個 llamafile 同時作為大語言模型和嵌入向量後端,將本機檔案與 Wikipedia 頁面建立向量索引,再透過 RAG 回答問題。整個助理在本機運行,毋須註冊雲端服務、支付 API 呼叫費用或把資料傳給第三方。
LlamaIndex 推出 Property Graph Index,以標記屬性圖表示擴展知識圖譜的建模、儲存與查詢能力。它支援 schema 引導、隱式及自由形式抽取,並可組合關鍵詞/同義詞、向量相似度、Cypher 查詢與自訂圖遍歷。圖譜節點預設會生成嵌入向量,底層儲存支援記憶體、磁碟及 Neo4j。
LlamaIndex 的 Property Graph Index 教程示範以 schema 引導抽取來建構知識圖譜,並加入實體去重與自訂檢索器,以提高 GraphRAG 準確度。示例使用 Diffbot 新聞資料集中的 250 篇文章建圖,使用 GPT-4o 約需 7 分鐘;去重結合嵌入向量相似度與詞距,自訂檢索器則先抽取查詢中的實體,再逐一使用 VectorContextRetriever。
LlamaIndex 發佈開源框架 llama-agents 的 alpha 版本,旨在簡化多智能體 AI 系統的構建、迭代與部署,並將智能體轉為生產環境微服務。
LlamaIndex 已向用户廣泛提供 LlamaParse,面向企業級 LLM 和 RAG 應用,支援複雜文件解析、資料接入與檢索。它支援 50+ 種語言和 100+ 種文件格式,檢索可配置 hybrid search、reranking 和 metadata filtering。LlamaParse Playground 可在部署前測試和調整資料接入及檢索策略。
LlamaIndex 助力 Lyzr 的企業自主 AI 智能體業務在不到 60 天內,ARR 由約 $100,000 升至約 $1.5 million。LlamaIndex 以數據連接器、RAG 上下文增強和彈性檢索支援其智能體;Lyzr 有 75% 客户使用兩個或以上 AI 智能體。
Arize AI 與 LlamaIndex 推出 LlamaTrace,這是一個原生支援 LlamaIndex 與 Arize 生態系的大語言模型追蹤及可觀測性託管平台。
LlamaIndex 宣佈推出 LlamaExtract Beta,這項託管服務可從非結構化文件推斷 schema,並按指定 schema 抽取結構化資料。用户可修改推斷出的 schema,或自行定義 schema;已有 schema 時,服務會逐份文件進行抽取。服務提供 UI 和 API,schema 推斷目前最多處理 5 個文件、每份最多 10 頁。
LlamaParse 推出文件級檢索 API,讓系統按問題需求取得整份文件內容,而不只檢索相關區塊。文件級檢索可按元資料或文件內容選擇文件,並支援調整 top-k 結果及按元資料篩選。配套 Jupyter notebook 示範讓智能體按問題在文件級與區塊級檢索間選擇。
LlamaIndex 推出 workflows beta,讓複雜 AI 應用可透過事件驅動架構編排。工作流由 Python 函數步驟組成,步驟可用事件觸發迴圈、自我修正,並透過 Context 分享執行期間的狀態。功能亦支援非同步與 streaming,並提供可觀測性、工作流視覺化和逐步執行除錯。
LlamaParse 提供索引複製、分塊視覺化與快速迭代功能,協助開發者測試和調整 RAG 流程的分塊大小,無須手動管理資料儲存或進行複雜重新索引。示例以 512 tokens 為基準,改用 Page 分段及 None 分塊設定後,回答更完整涵蓋 SWE-bench 的特徵。
LlamaIndex 的指南介紹如何使用 LlamaIndex 和 Azure OpenAI,在 Microsoft Azure 上構建無伺服器 RAG 應用程式。
LlamaIndex 宣佈在企業級 RAG 平台 LlamaParse 推出多模態功能,讓開發者可在數分鐘內建立同時索引及檢索文字與圖像的 RAG 管線。啟用 Multi-Modal Indexing 後,系統會把頁面截圖與提取文字一併建立索引,並可透過 API 接入應用程式。
LlamaIndex 推出 LlamaParse Premium,結合多模態模型與啟發式文本解析,處理複雜文件中的文本、表格和視覺內容。輸出可將文字、表格和圖像整理為結構化 Markdown,並把圖表轉成 Mermaid、公式輸出為 LaTeX,為所有圖像加上説明。
LlamaIndex 已整合 MistralAI 的 Pixtral 12B,提升圖表分析、圖像理解及圖像轉程式碼能力。本期亦提供以 OpenAI o1 和 LlamaParse 處理多工作表 Excel 的進階 RAG 指南,以及使用 LlamaParse 建立市場研究報告多模態 RAG 流程的教學。
LlamaIndex 公佈第二屆 Agentic RAG-a-thon 得獎項目及活動回顧。三日活動錄得逾 500 次註冊、45 個項目及 12 個贊助商,並頒發 $14,700 現金獎。首獎 Timeline of You 分析個人資料並生成職涯時間線;Closing.WTF 和 OilyRAGs 分獲二、三名。
LlamaIndex 本週推出 Mistral-3B 和 Mistral-8B 的 day-0 整合,並分享以 LlamaParse 從 ArXiv 論文知識庫生成綜述報告的遞迴式智能體工作流程。另有動態 few-shot prompting 專案,按查詢檢索相關示例以改善客户支援和 text-to-SQL,並列出多項 RAG、智能體應用案例及招聘職位。
NVIDIA 使用 LlamaIndex 與 NVIDIA NIM 為銷售代表打造 AI 銷售助理,支援內部知識檢索、翻譯及撰寫電郵等任務。系統按查詢類型將問題交予 Llama 3.1 405b,或以 Llama 3.1 70b 執行多來源 RAG,以較快、較低成本處理大量文件。Chainlit 提供聊天介面,RAG 資料來源包括內部文件庫、NVIDIA 網站及公開互聯網。
Jeff Davis 以 LlamaIndex 建成 OilyRAGs,這款多模態、免提式 RAG 維修技工助手的原型聚焦船艇維修。它可用手機辨識引擎型號、診斷問題及查詢零件,並生成數碼表格;作者稱操作速度提升 6,000%。該原型在 LlamaIndex 的 RAG-A-THON 獲第三名,數據可供 RAG 系統日後查詢。