LangChain 與 Amazon Bedrock Knowledge Bases 的 Agentic retrieval 實作教學
AWS 文章示範如何以 LangChain 在 Amazon Bedrock Knowledge Bases 建立 RAG 應用,並比較標準檢索與 Agentic retrieval 處理多部分問題的方式。
AWS 文章示範如何以 LangChain 在 Amazon Bedrock Knowledge Bases 建立 RAG 應用,並比較標準檢索與 Agentic retrieval 處理多部分問題的方式。
AWS 介紹並部署 Adjudicated Query 模式,讓 Amazon Quick 的自然語言合規查詢透過固定 MCP 操作交由確定性規則引擎判定,而非由模型作出決策。
推薦理由:文章把自然語言查詢與合規判定分開,並以完整性收據和逐筆證據鏈展示如何核對大量檢查結果。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。
推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。
Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。
推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驅動的 Cross-Corpus Retrieval 公開預覽,透過多智能體規劃、路由及充分上下文檢查,迭代搜尋跨來源資料。
Mistral AI 發佈開源 Search Toolkit 公開預覽版,將資料匯入、檢索與評估整合為共享介面的 AI 搜索框架。它內置 BM25 稀疏檢索、基於嵌入向量的密集檢索及混合檢索,並提供 recall、precision、MRR 和 NDCG 指標,可在自有測試集評估。框架可在雲端、本地部署及邊緣環境運行,並提供 starter app template。
PaddleOCR 3.5 為支援的 OCR 與文件解析模型加入 Transformers 推理後端,開發者可透過 `engine` 參數選擇。`engine_config` 可設定 dtype、裝置配置及 attention implementation;若優先考慮 OCR 或文件解析吞吐量,文章通常建議使用預設的 paddle_static 後端。
IBM Granite 發佈兩款採 Apache 2.0 授權的多語嵌入模型:97M 參數的 granite-embedding-97m-multilingual-r2 和 311M 參數的 granite-embedding-311m-multilingual-r2。
推薦理由:文章提供 97M 與 311M 版本在多語檢索、長文及程式碼基準的比較,並交代 Matryoshka 維度選項對儲存與部署取捨的影響。
Sentence Transformers v5.4 的同一 API 現可編碼並比較文字、圖像、音訊和影片,文章示範其多模態嵌入與 reranker 用法。嵌入模型將不同模態映射至共享嵌入空間;預訓練多模態 reranker 目前主要處理文字與圖像配對。示例涵蓋跨模態檢索、混合模態文件重排及先檢索再重排流程,並列出輸入格式、支援模型和安裝依賴。
推薦理由:文章展示 Sentence Transformers v5.4 的跨模態檢索與 reranker 重排流程,並整理支援模型和輸入格式,提供實作參考。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。
推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。
Mistral AI 發佈首款程式碼專用嵌入模型 Codestral Embed,面向真實程式碼檢索。官方稱其檢索表現優於 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型;採用 256 維、int8 精度時仍優於競品。
Mistral AI 發佈 Agents API,將內置連接器、跨對話記憶及智能體編排整合為構建 AI 智能體的框架。內置連接器涵蓋代碼執行、網絡搜索、圖像生成、Document Library 及 MCP 工具;啟用網絡搜索後,Mistral Large 和 Mistral Medium 在 SimpleQA 的分數分別由 23% 和 22.08% 升至 75% 和 82.32%。
推薦理由:Agents API 把內置連接器、跨對話記憶和多智能體編排納入同一框架,並以 SimpleQA 數據呈現網絡搜索前後的分數差異。
Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。
推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。
這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。
推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。
Open Arabic LLM Leaderboard 2 更新阿拉伯語大語言模型評測基準,移除飽和及機器翻譯任務,採用原生阿拉伯語或人工翻譯基準。
Answer.AI 與 LightOn 發佈 ModernBERT,提供 base(149M params)及 large(395M params)兩種僅編碼器版本。
推薦理由:文章將 ModernBERT 的架構、效率與訓練改動連結至長上下文檢索及程式碼檢索場景,呈現編碼器更新對實際應用的意義。
HuggingChat 推出 Community Tools,讓使用者可把 Hugging Face 上的公開 Space 轉成模型可直接調用的工具。這些工具可用於理解圖片、生成影片或文字轉語音,也可建立文件 RAG 工具。建立助手時最多可選 3 個工具;該功能目前仍屬實驗階段。
推薦理由:文章展示如何把公開 Space、自建 Gradio 工具和文件 RAG 接入 HuggingChat,並在助手中組合最多 3 個工具,提供從建立到配置的實操路徑。
Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。
推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。
Banque des Territoires、Polyconseil 與 Hugging Face 完成 EduRénov 首階段合作,開發主權數據 RAG 工具以支援地方政府。EduRénov 旨在協助 10,000 項公立學校設施翻新工程,並在 5 年內實現 40% 能源節省。項目要求確保所用運算服務與模型的主權。
Hugging Face 宣佈 Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 部署嵌入向量模型,支援包括 RAG 在內的生成式 AI 應用。
Hugging Face Blog 示範以 Intel Xeon CPU 運行嵌入模型、以 Intel Gaudi 2 運行 LLM,並透過 LangChain、Redis 和 TGI 構建及部署企業級 RAG 應用。
Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。
推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。