LlamaIndex 解析多模態 RAG 評估方法
LlamaIndex 介紹多模態 RAG 的評估方法,建議沿用文字型 RAG 的檢索與生成兩階段框架,並分別計算文字和圖片的檢索指標。生成評估則可使用能處理文字及圖像上下文的 LMM 作裁判,衡量相關性與忠實度;文中亦介紹其 beta Multi-Modal Evaluator abstractions。
LlamaIndex 介紹多模態 RAG 的評估方法,建議沿用文字型 RAG 的檢索與生成兩階段框架,並分別計算文字和圖片的檢索指標。生成評估則可使用能處理文字及圖像上下文的 LMM 作裁判,衡量相關性與忠實度;文中亦介紹其 beta Multi-Modal Evaluator abstractions。
LlamaIndex 在 2023–12–12 電子報中介紹多項產品更新,涵蓋 RAG 評測、資料管線、多模態功能及開發模板。
LlamaIndex 已整合 MistralAI 的 Pixtral 12B,提升圖表分析、圖像理解及圖像轉程式碼能力。本期亦提供以 OpenAI o1 和 LlamaParse 處理多工作表 Excel 的進階 RAG 指南,以及使用 LlamaParse 建立市場研究報告多模態 RAG 流程的教學。
LLM 正革新企業 PDF 解析,從單純讀取文字轉向理解文件版面與內容;LlamaParse 利用視覺語言模型處理文字和視覺元素,並保留文件結構。平台可處理表格、掃描文件、表單及技術圖紙,並透過 LlamaExtract 輸出 Markdown、JSON、XML 或自訂格式。服務提供免費及付費方案,實施指南涵蓋文件盤點、試點、擴展及正式部署。
LLM 正重塑 AI 文件解析,讓機器能從文字與圖像理解文件版面、語義及上下文。相較 OCR、NLP、NER 等依賴模板與規則的工具,多模態 LLM 可重建語義閲讀順序、理解圖表與表格,並處理新文件類型而毋須重新訓練。但單靠標準 LLM API 解析複雜版面,仍可能漏掉細節或產生幻覺數值。
LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。
LlamaIndex 建立了 audio-kb CLI 工具,讓使用者可從終端錄製或上傳音訊筆記,並對筆記進行語義搜尋。工具以 LlamaParse 提取逐字稿,將文本分塊後用 Gemini Embedding 2 產生嵌入向量,再存入帶有 HNSW 索引的本地 SurrealDB。
LlamaParse 以多模態模型解析法律證據開示文件,可處理低畫質掃描件,並理解頁面版面、圖片、圖表及表格。它支援自訂解析指示,API 可回傳「markdown」、「text」及「items」等輸出。文章建議這類文件使用 `tier="agentic_plus"`,該層級針對複雜版面與視覺內容優化;所有 tier 均採用高解析度 OCR。
圖表數據提取須將圖中的視覺標記映射為座標數值,再整理成結構化資料;流程包括識別圖表類型、解析座標軸與圖例、定位數據點及匯出。人工數位化通常每張圖需 15 至 30 分鐘,傳統 OCR 只能辨識文字;AI/VLM(如 LlamaParse)可處理多種圖表,並輸出 CSV、JSON 或 Markdown,附信心分數與引用。
2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。
LlamaIndex 復盤 LlamaParse 文件處理流程中的兩類生產故障:模型重複輸出造成延遲與資源耗盡,recitation 內容攔截則令生成中止並使下游流程出錯。
LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。
Meta 公佈 Ray-Ban Display 眼鏡 2026 年下半年大型更新詳情,涵蓋導航、通知管理、Hologram 虛擬化身及 Explore 應用推薦。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。
MiniMax 發佈 Music 3.0 音樂生成模型,可依據創意概念及可選歌詞,在一次生成中完成最長 5 分鐘的歌曲。模型採用 8 層 RVQ、由 Qwen3.5-8B 初始化的 8B Global LLM、0.6B Local LLM,並透過 2.4B flow-matching 模組及 123M Flow-VAE 重建音訊。
Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。
Google 在 Gemini Live 推出 Guided Vision,讓相容 Android 裝置以 AI 即時語音描述手機鏡頭所拍攝的內容。它可協助讀取細小文字、描述周遭環境、尋找或辨認物件及描述物件細節,並支援追問;亦可透過 Google TalkBack 使用,或在 Android 9 及以上裝置設定無障礙捷徑。
OpenAI 全球推出 ChatGPT 虛擬試穿及商品收藏兩項購物功能,用户可上傳自拍、全身照或商品圖片,預覽衣物與配飾穿上身的效果。虛擬試穿入口會出現在購物結果中的 Try On 按鈕;Favorites 可把商品保存至應用程式 Library 以便稍後查看。OpenAI 表示,這些功能使用新推出的 ChatGPT Images 2.5。
Tavus 發佈 Griffin,稱其為首個「Human Interaction Model」(HIM);其研究中,48% 參與者在一分鐘視像通話後認為 Griffin 是真人。
Microsoft Research 介紹 Quine,一個結合生物學多模態世界模型與互動式研究流程的 AI 研究系統,並開放首屆 Quine Fellows 計劃申請。
推薦理由:Quine 將跨生物模態的世界模型接入文獻、科研工具與實驗迴圈,並以胰臟癌細胞狀態轉換案例展示預測如何進入濕實驗驗證。
OpenMOSS 發佈 MOSS-VL 開放權重影片理解模型系列,涵蓋連續影片即時互動、離線理解及後續訓練三類用途。系列包括 MOSS-VL-Realtime、MOSS-VL-Instruct-0708 和 MOSS-VL-Base-0708,分別面向即時互動、離線任務,以及持續預訓練和微調。三款模型均為 11B 參數,支援 256K 上下文窗口;倉庫亦提供即時與離線推理、部署和微調資源。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,將近乎即時視像生成與語音結合,讓企業智能體以動態虛擬形象進行多模態對話。
Sarvam AI 發佈 Sarvam Vision 2.1,強化表格解析、表單鍵值擷取及 Indic 手寫識別。在 olmOCR-Bench 官方集合中,模型得 87.3 分,為表列最高;在 OmniDocBench v1.6 得 94.97 分,低於 PaddleOCR-VL 1.6 的 96.01 分。
Meta 在 Connect 2026 以 Muse 個人智能體為核心,推出眼鏡和多項功能,並預告尚未發佈的新前沿模型。Muse 現支援語音及即時影片,可在背景處理任務;Mac 版新增電腦操作,Muse Mail 可透過專屬電郵地址接收待處理事項,連接器平台有 1,500+ 個應用程式。
小米推出 MiMo-V2.6-Pro,該模型在 Artificial Analysis Intelligence Index 得 46 分,排名開放權重模型首位。
推薦理由:文中並列模型榜單、RL 訓練成本與將開源的環境配方,呈現這次發佈由模型權重延伸至後訓練流程的技術脈絡。
非侵入式 AI 腦機接口公司華超神控完成 2 億元人民幣 Pre-A 輪融資,由雲啟資本與紅杉中國聯合領投。比鄰星投資、元禾控股、徐匯科創投、德石投資跟投,經緯創投和德聯資本持續加註;所募資金將用於產品研發、核心人才引進、臨牀研究推進和 AI 基礎設施建設。公司以超聲神經調控、多模態讀腦和 AI 神經解碼為核心技術路徑,佈局科研、臨牀、科技三條產品線。
vLLM 整合 PyNvVideoCodec,支援使用 NVIDIA GPU 解碼影片,將影片解碼工作從 CPU 移走,以擴展多 GPU 影片字幕生成吞吐量。在 8 張 H100 的測試中,GPU 解碼吞吐量比 CPU 解碼高逾一倍,且大型負載的 CPU 瓶頸消除。PyNvVideoCodec 已包含於標準 CUDA 版 vLLM;自訂安裝需加入 PyNvVideoCodec==2.0.4。
inclusionAI 發佈 Ming-Image-0.1-Design-Layer,可按輸入圖像及圖層規劃,將扁平設計圖像拆分為指定數量的 RGBA 圖層。模型提供六層卡片製作示例,建議工作分辨率為 1024,亦可使用 512 加快分層;採樣步數為 12,驗證配置為一張 CUDA GPU、80 GiB VRAM。
MIT 與合作機構研究人員開發 xvr,將術中 X 光與患者術前 3D 醫學影像配準;模型約 5 分鐘即可適配新患者,並在數秒內完成亞毫米精度配準。系統以患者 CT 或 MRI 進行物理模擬,生成合成 X 光,並使用逾 2,000 名患者的全身 3D 掃描預訓練基礎模型。在涵蓋 5 間醫院的資料測試中,xvr 的準確度和穩健性比其他 AI 方法高一個數量級。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
IBM 與 NASA 開源 NASA-IBM Lunar Foundation Model,整合數十年美國及日本月球任務的多模態觀測資料。在冰區識別中,模型的錯誤率比用於冰區探測的 SwinV2 降低 22%;在 100 米/像素撞擊坑檢測中,較以撞擊坑檢測訓練的 Swin 模型高近 19%,並使用一半訓練資料。
DeepSeek-V4.1-Flash 正式發佈,是 DeepSeek 新架構系列中最小的模型,並支援原生多模態視覺理解。
FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
Intern Lumina U2 推理代碼已公開,Ascend 訓練權重已上架 Hugging Face;NVIDIA 權重、訓練代碼與技術報告將後續推出。模型為 16B-A1B MoE,採用基於 AToken 的 8-codebook 視覺表示,支援文字問答、文生圖、圖像編輯及圖像、影片和 3D 理解。
Google Earth AI 介紹實驗性行星預測引擎(PPE),可根據自然語言查詢自主完成地理空間資料搜尋、整理、模型訓練與評估。測試中,21 項 CDC 健康指標的平均 R² 為 76.8%,高於人工專家流程的 60.0%;尼日利亞糧食安全由 ADM1 下採樣至 ADM2,R² 為 66.1%,基線為 31.5%。
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。