如何使用 Sentence Transformers 訓練 CPU 推理速度快 100 至 400 倍的靜態嵌入模型
Hugging Face Blog 公開兩款靜態嵌入模型,稱其 CPU 推理比常見嵌入模型快 100 至 400 倍,且多項基準保留至少 85% 表現。
推薦理由:文章公開兩款模型的訓練配方與資料集,並以 NanoBEIR 結果呈現靜態嵌入模型在 CPU 速度與檢索品質間的取捨。
Hugging Face Blog 公開兩款靜態嵌入模型,稱其 CPU 推理比常見嵌入模型快 100 至 400 倍,且多項基準保留至少 85% 表現。
推薦理由:文章公開兩款模型的訓練配方與資料集,並以 NanoBEIR 結果呈現靜態嵌入模型在 CPU 速度與檢索品質間的取捨。
Mistral AI 發佈程式碼模型 Codestral 25.01,稱其架構和 tokenizer 經改進,生成及補全程式碼的速度約為原版 2 倍。在所列基準中,Codestral-2501 的 HumanEvalFIM 平均分為 85.9%,高於 Codestral-2405 的 82.1%。
推薦理由:文中列出 Codestral 25.01 與舊版及其他模型的程式基準,並交代速度變化和部署入口,便於對照補全表現與採用方式。
DeepSeek 將 deepseek-chat 模型升級為 DeepSeek-V3,API 保持不變。使用者仍可透過指定 model='deepseek-chat' 調用 DeepSeek-V3。
推薦理由:這次更新交代 DeepSeek-V3 與既有 API 調用方式的關係,使用者仍可指定 deepseek-chat 調用新模型,便於沿用現有接入方式。
Answer.AI 與 LightOn 發佈 ModernBERT,提供 base(149M params)及 large(395M params)兩種僅編碼器版本。
推薦理由:文章將 ModernBERT 的架構、效率與訓練改動連結至長上下文檢索及程式碼檢索場景,呈現編碼器更新對實際應用的意義。
IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。
推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。
OpenAI 發佈 o1,並公佈面向開發者的多項更新。內容包括 Realtime API 改進和一種新的微調方法。
推薦理由:公告將 o1、Realtime API 改進與新微調方法一併面向開發者呈現,可用來把握 OpenAI 此次更新涵蓋的模型與開發工具範圍。
Technology Innovation Institute(TII)發佈 Falcon3 開放模型系列,推出 Falcon3-1B-Base、Falcon3-3B-Base、Falcon3-7B-Base、Falcon3-10B-Base 及 Falcon3-Mamba-7B-Base 五款基礎模型。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2.5-1210,並改善多項能力。MATH-500 成績由 74.8% 提升至 82.8%,LiveCodebench(08.01 - 12.01)準確率由 29.2% 升至 34.38%;內部測試亦顯示寫作和推理有所改善。新版本亦優化檔案上傳和網頁摘要功能的使用體驗。
OpenAI 的影片生成模型 Sora 現已可在 sora.com 使用,支援生成最高 1080p、最長 20 秒的影片。影片可採寬屏、直向或正方形畫幅;用户可用自備素材延展、改編或混合影片,也可單憑文字生成全新內容。
推薦理由:Sora 的可用入口及生成規格清晰列出,涵蓋影片時長、解像度、畫幅選擇,以及文字生成和自備素材改編等方式。
Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。
推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。
Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。
推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。
Mistral AI 發佈 Pixtral Large,一款基於 Mistral Large 2 的 124B 開放權重多模態模型,支援 128K 上下文窗口。
推薦理由:Pixtral Large 在 MathVista 得分 69.4%,並於 ChartQA、DocVQA 超越 GPT-4o 和 Gemini-1.5 Pro;這些結果提供數學視覺推理、圖表與文件理解的具體比較參照。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
Stable Diffusion 3.5 Large(8B)及其 timestep 蒸餾版(8B)已在 Hugging Face Hub 提供,並可透過 Diffusers 進行推理與訓練。
推薦理由:文章把 Diffusers 中的量化推理與 LoRA 微調落到具體步驟,並提供在 24GB VRAM 消費級 GPU 上微調 SD3.5 Large 的參考路徑。
Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。
推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。
Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。
推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。
Mistral AI 公佈多項更新,包括 Mistral Small v24.09、la Plateforme 免費層、模型降價及 le Chat 免費提供 Pixtral 12B 圖像理解。
推薦理由:免費層涵蓋開發者的實驗、評估與原型製作,價格表亦列出模型新舊費率及降幅,呈現試用門檻和 API 成本的變化。
Mistral AI 發佈 Pixtral 12B,這款多模態模型採用基於 Mistral Nemo 的 12B 參數解碼器,以及從零訓練的 400M 參數視覺編碼器。它支援不同尺寸與長寬比的圖像,並可在 128K tokens 上下文窗口中處理多張圖片;在 MMMU 推理基準上取得 52.5%。模型採用 Apache 2.0 授權,可透過 Le Chat 或 La Plateforme 試用。
推薦理由:Mistral AI 以相同評測流程比較 Pixtral 12B 與多個開源及閉源模型,並列出 MMMU 52.5% 等基準結果,便於理解其多模態表現。
OpenAI 推出 o1。
DeepSeek 將 DeepSeek V2 Chat 與 DeepSeek Coder V2 合併升級為 DeepSeek V2.5。
阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。
推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。
推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。
DeepSeek 將 deepseek-coder 模型升級至 DeepSeek-Coder-V2-0724。這項升級記錄於 DeepSeek API 更新日誌。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
GPT-4o mini 旨在推動更具成本效益的智能。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。
推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。
Mistral AI 發佈 Mathstral,這款以 Mistral 7B 為基礎、專攻 STEM 的模型面向複雜數學推理。Mathstral 7B 在 MATH 得分 56.6%、MMLU 得分 63.47%;加入多數投票後,MATH 得分為 68.37%,使用強力獎勵模型並在 64 個候選項中評選時為 74.59%。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0628,並稱模型的推理能力有所提升。HumanEval Pass@1 由 79.88% 升至 84.76%,MATH ACC@1 由 55.02% 升至 71.02%,BBH 由 78.56% 升至 83.40%。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。
DeepSeek 將 deepseek-coder 升級至 DeepSeek-Coder-V2-0614,編碼能力顯著提升。其程式碼生成、理解、除錯及補全能力達到 GPT-4-Turbo-0409 水平,數學與推理能力出色,通用能力則與 DeepSeek-V2-0517 相當。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。
推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。
TII 發佈 Falcon 2 系列的 11B LLM 與 11B VLM,VLM 可接收圖像並回答相關問題。LLM 使用逾 5000B tokens 訓練,主要支援英語,並對另外 10 種語言具備良好能力。VLM 結合 CLIP ViT-L/14 視覺編碼器,先以 558K 圖像描述配對訓練多模態投影器,再以 1.2M 圖像文字指令資料微調。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 準確率由 63.9% 升至 77.6%。
Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。
推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。
OpenAI 在 ChatGPT 免費提供 GPT-4o,並推出新的語音及影片模式。Sam Altman 形容新模式的回應速度和表達能力達到人類水平,令與電腦交談感覺自然。他亦提到,會加入可選的個人化、存取用户資訊及代用户採取行動等能力。
推薦理由:文章並列 GPT-4o 免費提供與新語音、影片模式,呈現 OpenAI 擴大高能力 AI 使用範圍和改善人機互動的兩個方向。
OpenAI 宣佈 GPT-4 Omni(GPT-4o)為新的旗艦模型。該模型可即時跨音訊、視覺和文字進行推理。
推薦理由:公告把 GPT-4o 定位為新旗艦模型,並明確列出音訊、視覺和文字的即時推理能力,讓讀者掌握此次宣佈的多模態重點。