SourceLearn:從知識存取到來源學習,培養對特定來源的理解能力
SourceLearn 框架讓 AI 智能體隨時間建立可重用、針對特定來源的理解能力。在 13/15 個設定中取得最佳結果,較 Hybrid RAG 最多提升 +22.6 分;移除關鍵文件後,表現約下跌 8 分,Hybrid RAG 則下跌 25 分。學習成果亦可遷移至未練習的任務,改善指引任務未直接涵蓋的來源部分。
SourceLearn 框架讓 AI 智能體隨時間建立可重用、針對特定來源的理解能力。在 13/15 個設定中取得最佳結果,較 Hybrid RAG 最多提升 +22.6 分;移除關鍵文件後,表現約下跌 8 分,Hybrid RAG 則下跌 25 分。學習成果亦可遷移至未練習的任務,改善指引任務未直接涵蓋的來源部分。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。
推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。
Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。
推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驅動的 Cross-Corpus Retrieval 公開預覽,透過多智能體規劃、路由及充分上下文檢查,迭代搜尋跨來源資料。
Mistral AI 發佈開源 Search Toolkit 公開預覽版,將資料匯入、檢索與評估整合為共享介面的 AI 搜索框架。它內置 BM25 稀疏檢索、基於嵌入向量的密集檢索及混合檢索,並提供 recall、precision、MRR 和 NDCG 指標,可在自有測試集評估。框架可在雲端、本地部署及邊緣環境運行,並提供 starter app template。
PaddleOCR 3.5 為支援的 OCR 與文件解析模型加入 Transformers 推理後端,開發者可透過 `engine` 參數選擇。`engine_config` 可設定 dtype、裝置配置及 attention implementation;若優先考慮 OCR 或文件解析吞吐量,文章通常建議使用預設的 paddle_static 後端。
IBM Granite 發佈兩款採 Apache 2.0 授權的多語嵌入模型:97M 參數的 granite-embedding-97m-multilingual-r2 和 311M 參數的 granite-embedding-311m-multilingual-r2。
推薦理由:文章提供 97M 與 311M 版本在多語檢索、長文及程式碼基準的比較,並交代 Matryoshka 維度選項對儲存與部署取捨的影響。
Sentence Transformers v5.4 的同一 API 現可編碼並比較文字、圖像、音訊和影片,文章示範其多模態嵌入與 reranker 用法。嵌入模型將不同模態映射至共享嵌入空間;預訓練多模態 reranker 目前主要處理文字與圖像配對。示例涵蓋跨模態檢索、混合模態文件重排及先檢索再重排流程,並列出輸入格式、支援模型和安裝依賴。
推薦理由:文章展示 Sentence Transformers v5.4 的跨模態檢索與 reranker 重排流程,並整理支援模型和輸入格式,提供實作參考。
Hamel Husain 認為,LLM API 雖讓團隊可自行整合 AI,評測、實驗設計和生產監測仍需要數據科學方法。文中列出五類評測陷阱,包括套用通用指標、未驗證 LLM 評審、測試集設計不當、數據及標籤質素欠佳,以及過度自動化。作者建議檢視 traces、以人工標註驗證評審,並根據真實生產數據設計測試集,讓領域專家參與標註。
Inception Labs 發佈 Mercury 2 推理語言模型,透過擴散模型並行修訂生成回應,主打低延遲推理。官方列出其在 NVIDIA Blackwell GPUs 上達 1,009 tokens/sec,並稱生成速度提升 >5x;價格為 $0.25/1M input tokens、$0.75/1M output tokens。
SearchBlox 將 Inception 的 Mercury dLLM 整合至 SearchAI 的 RAG 流程,為企業搜尋提供低於 1 秒的 GenAI 回應。Mercury 令推理成本降低 60% 至 90%。客户可在 AWS Bedrock 或 Azure Foundry 部署 Mercury,數據不會離開其私有雲實例。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
OpenAI 的 File search 指南説明,Responses API 可透過語義與關鍵詞搜尋,從已上傳檔案的知識庫檢索資訊。指南示範先建立 vector store 並上傳檔案,再將 file_search 加入可用工具;此工具由 OpenAI 託管,模型決定調用時會自動搜尋檔案並返回結果。
OpenAI Developers 歸納出七項 LLM 應用延遲優化原則,涵蓋 token 處理、減少請求、並行執行、改善用户等待體驗及避免不必要地使用 LLM。
OpenAI 提出提升 LLM 正確性與行為一致性的優化框架,建議先透過評估診斷失誤,再按問題選用提示詞、RAG 或微調。在冰島語校正測試中,GPT-4 零樣本的 BLEU 為 62,加入 3 個 few-shot examples 後為 70;以 1000 個例子微調 GPT-4 後為 87,再加入 RAG 則降至 83。
OpenAI Developers 提供一套面向開發者的 AI 應用開發學習路線,按四階段涵蓋基礎概念、應用開發、測試與評估,以及規模化和維護。內容介紹如何透過 Responses API 或 Agents SDK 建置智能體,並説明 RAG 用於引入知識、微調用於調整模型行為,以及用 evals 和 guardrails 測試與約束應用。
Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。
推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。
Mistral AI 發佈首款程式碼專用嵌入模型 Codestral Embed,面向真實程式碼檢索。官方稱其檢索表現優於 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型;採用 256 維、int8 精度時仍優於競品。
Mistral AI 發佈 Agents API,將內置連接器、跨對話記憶及智能體編排整合為構建 AI 智能體的框架。內置連接器涵蓋代碼執行、網絡搜索、圖像生成、Document Library 及 MCP 工具;啟用網絡搜索後,Mistral Large 和 Mistral Medium 在 SimpleQA 的分數分別由 23% 和 22.08% 升至 75% 和 82.32%。
推薦理由:Agents API 把內置連接器、跨對話記憶和多智能體編排納入同一框架,並以 SimpleQA 數據呈現網絡搜索前後的分數差異。
OpenAI Developers 的 cookbook 示範以 Responses API 建立 RAG 多工具工作流程,按查詢將請求路由至內置工具或外部工具。示例結合內置網絡搜尋與 Pinecone 向量資料庫檢索,並展示先搜尋網頁、再查詢 Pinecone,將工具結果交回 API 生成答案。
Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。
推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。
這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。
推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。
Open Arabic LLM Leaderboard 2 更新阿拉伯語大語言模型評測基準,移除飽和及機器翻譯任務,採用原生阿拉伯語或人工翻譯基準。
Answer.AI 與 LightOn 發佈 ModernBERT,提供 base(149M params)及 large(395M params)兩種僅編碼器版本。
推薦理由:文章將 ModernBERT 的架構、效率與訓練改動連結至長上下文檢索及程式碼檢索場景,呈現編碼器更新對實際應用的意義。
HuggingChat 推出 Community Tools,讓使用者可把 Hugging Face 上的公開 Space 轉成模型可直接調用的工具。這些工具可用於理解圖片、生成影片或文字轉語音,也可建立文件 RAG 工具。建立助手時最多可選 3 個工具;該功能目前仍屬實驗階段。
推薦理由:文章展示如何把公開 Space、自建 Gradio 工具和文件 RAG 接入 HuggingChat,並在助手中組合最多 3 個工具,提供從建立到配置的實操路徑。
Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。
推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。
Banque des Territoires、Polyconseil 與 Hugging Face 完成 EduRénov 首階段合作,開發主權數據 RAG 工具以支援地方政府。EduRénov 旨在協助 10,000 項公立學校設施翻新工程,並在 5 年內實現 40% 能源節省。項目要求確保所用運算服務與模型的主權。
Hugging Face 宣佈 Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 部署嵌入向量模型,支援包括 RAG 在內的生成式 AI 應用。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 準確率由 63.9% 升至 77.6%。
Hugging Face Blog 示範以 Intel Xeon CPU 運行嵌入模型、以 Intel Gaudi 2 運行 LLM,並透過 LangChain、Redis 和 TGI 構建及部署企業級 RAG 應用。
Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。
推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。