跳到正文

#多模態

今日 34 條
10月3日週六
  1. LlamaIndex:產品、工程與評測56

    LlamaIndex 解析多模態 RAG 評估方法

    LlamaIndex 介紹多模態 RAG 的評估方法,建議沿用文字型 RAG 的檢索與生成兩階段框架,並分別計算文字和圖片的檢索指標。生成評估則可使用能處理文字及圖像上下文的 LMM 作裁判,衡量相關性與忠實度;文中亦介紹其 beta Multi-Modal Evaluator abstractions。

  2. LlamaIndex:產品、工程與評測42

    LlamaIndex 2024-10-01 電子報

    LlamaIndex 已整合 MistralAI 的 Pixtral 12B,提升圖表分析、圖像理解及圖像轉程式碼能力。本期亦提供以 OpenAI o1 和 LlamaParse 處理多工作表 Excel 的進階 RAG 指南,以及使用 LlamaParse 建立市場研究報告多模態 RAG 流程的教學。

  3. LlamaIndex:產品、工程與評測34

    超越 OCR:LLM 如何革新企業文件處理中的 PDF 解析

    LLM 正革新企業 PDF 解析,從單純讀取文字轉向理解文件版面與內容;LlamaParse 利用視覺語言模型處理文字和視覺元素,並保留文件結構。平台可處理表格、掃描文件、表單及技術圖紙,並透過 LlamaExtract 輸出 Markdown、JSON、XML 或自訂格式。服務提供免費及付費方案,實施指南涵蓋文件盤點、試點、擴展及正式部署。

  4. LlamaIndex:產品、工程與評測26

    AI 文件解析:LLM 正重塑機器讀取與理解文件的方式

    LLM 正重塑 AI 文件解析,讓機器能從文字與圖像理解文件版面、語義及上下文。相較 OCR、NLP、NER 等依賴模板與規則的工具,多模態 LLM 可重建語義閲讀順序、理解圖表與表格,並處理新文件類型而毋須重新訓練。但單靠標準 LLM API 解析複雜版面,仍可能漏掉細節或產生幻覺數值。

  5. LlamaIndex:產品、工程與評測45

    OlmOCR-Bench 評析:OCR 基準測試的洞見與陷阱

    LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。

  6. LlamaIndex:產品、工程與評測47

    解析難以辨讀的文件:LlamaParse 如何處理訴訟證據開示文件

    LlamaParse 以多模態模型解析法律證據開示文件,可處理低畫質掃描件,並理解頁面版面、圖片、圖表及表格。它支援自訂解析指示,API 可回傳「markdown」、「text」及「items」等輸出。文章建議這類文件使用 `tier="agentic_plus"`,該層級針對複雜版面與視覺內容優化;所有 tier 均採用高解析度 OCR。

  7. LlamaIndex:產品、工程與評測45

    LlamaIndex:圖表數據提取逐步指南

    圖表數據提取須將圖中的視覺標記映射為座標數值,再整理成結構化資料;流程包括識別圖表類型、解析座標軸與圖例、定位數據點及匯出。人工數位化通常每張圖需 15 至 30 分鐘,傳統 OCR 只能辨識文字;AI/VLM(如 LlamaParse)可處理多種圖表,並輸出 CSV、JSON 或 Markdown,附信心分數與引用。

  8. LlamaIndex:產品、工程與評測26

    2026 年面向全球文件辨識的最佳多語言 OCR 軟件

    2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。

  9. LlamaIndex:產品、工程與評測55

    LlamaIndex 解釋 VLM 為何難以解析表格

    LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。

  10. Meta AI:Research Blog76

    Meta 發佈 Muse Spark 1.1,並開放 Meta Model API 公開預覽

    Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。

    推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。

  11. MiniMax:Blog68

    MiniMax 發佈 H3 多模態生成模型,支援原生立體聲 2K 影片生成

    MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。

  12. TechCrunch · AI67

    Google 發佈 Gemini 4 Argon,稱其為迄今最強模型

    Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。

10月2日週五
  1. TechCrunch · AI65

    ChatGPT 新增衣物與配飾虛擬試穿功能

    OpenAI 全球推出 ChatGPT 虛擬試穿及商品收藏兩項購物功能,用户可上傳自拍、全身照或商品圖片,預覽衣物與配飾穿上身的效果。虛擬試穿入口會出現在購物結果中的 Try On 按鈕;Favorites 可把商品保存至應用程式 Library 以便稍後查看。OpenAI 表示,這些功能使用新推出的 ChatGPT Images 2.5。

9月29日週二
  1. Microsoft Research61

    Microsoft Research 介紹 Quine 生物學 AI 研究系統並開放 Fellows 計劃申請

    Microsoft Research 介紹 Quine,一個結合生物學多模態世界模型與互動式研究流程的 AI 研究系統,並開放首屆 Quine Fellows 計劃申請。

    推薦理由:Quine 將跨生物模態的世界模型接入文獻、科研工具與實驗迴圈,並以胰臟癌細胞狀態轉換案例展示預測如何進入濕實驗驗證。

9月28日週一
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI67

    OpenMOSS 發佈 MOSS-VL 開放權重影片理解模型系列

    OpenMOSS 發佈 MOSS-VL 開放權重影片理解模型系列,涵蓋連續影片即時互動、離線理解及後續訓練三類用途。系列包括 MOSS-VL-Realtime、MOSS-VL-Instruct-0708 和 MOSS-VL-Base-0708,分別面向即時互動、離線任務,以及持續預訓練和微調。三款模型均為 11B 參數,支援 256K 上下文窗口;倉庫亦提供即時與離線推理、部署和微調資源。

9月25日週五
9月24日週四
9月22日週二
  1. elsewhere:文章55

    華超神控完成 2 億元人民幣 Pre-A 輪融資,雲啟資本與紅杉中國聯合領投

    非侵入式 AI 腦機接口公司華超神控完成 2 億元人民幣 Pre-A 輪融資,由雲啟資本與紅杉中國聯合領投。比鄰星投資、元禾控股、徐匯科創投、德石投資跟投,經緯創投和德聯資本持續加註;所募資金將用於產品研發、核心人才引進、臨牀研究推進和 AI 基礎設施建設。公司以超聲神經調控、多模態讀腦和 AI 神經解碼為核心技術路徑,佈局科研、臨牀、科技三條產品線。

9月18日週五
  1. vLLM 官方博客58

    PyNvVideoCodec 與 vLLM 以硬件解碼提升多 GPU 影片字幕生成吞吐量

    vLLM 整合 PyNvVideoCodec,支援使用 NVIDIA GPU 解碼影片,將影片解碼工作從 CPU 移走,以擴展多 GPU 影片字幕生成吞吐量。在 8 張 H100 的測試中,GPU 解碼吞吐量比 CPU 解碼高逾一倍,且大型負載的 CPU 瓶頸消除。PyNvVideoCodec 已包含於標準 CUDA 版 vLLM;自訂安裝需加入 PyNvVideoCodec==2.0.4。

9月17日週四
9月16日週三
  1. MIT News57

    MIT 研究團隊開發 AI 系統 xvr,快速配準術中 X 光與術前 3D 醫學影像

    MIT 與合作機構研究人員開發 xvr,將術中 X 光與患者術前 3D 醫學影像配準;模型約 5 分鐘即可適配新患者,並在數秒內完成亞毫米精度配準。系統以患者 CT 或 MRI 進行物理模擬,生成合成 X 光,並使用逾 2,000 名患者的全身 3D 掃描預訓練基礎模型。在涵蓋 5 間醫院的資料測試中,xvr 的準確度和穩健性比其他 AI 方法高一個數量級。

9月10日週四
9月8日週二
  1. FireRedTeam:原創語音與多模態項目65

    FireRedTeam 發佈 FireRedAudio 通用音訊語言模型及 PyTorch 程式碼

    FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。

9月3日週四
9月1日週二
8月28日週五