SmolVLM2 將影片理解帶到各類裝置
Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。
推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。
Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。
推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。
Google 發佈 PaliGemma 2 Mix,這組視覺語言模型是在 OCR、長短圖像描述等任務上微調的 PaliGemma 2 版本。模型提供 3B、10B、28B 三種規模,以及 224 和 448 兩種解析度。模型涵蓋視覺問答、文件理解、圖中文字辨識和物件定位;物件偵測與圖像分割需使用任務前綴,其餘任務使用開放式提示詞表現較佳。
Mistral 推出 24B 參數的區域語言模型 Mistral Saba,支援阿拉伯語及多種印度源語言,並在 Tamil 等南印度源語言上表現尤佳。Mistral 稱,Mistral Saba 的回答比規模超過其 5 倍的模型更準確、相關,且速度更快、成本更低。它可透過 API 使用,也可在客户安全環境內本地部署,並能在單 GPU 系統上以每秒超過 150 tokens 的速度回應。
Mistral AI 發佈 Mistral Small 3,這款 24B 參數低延遲模型採用 Apache 2.0 授權,並提供預訓練及 instruction-tuned checkpoint。
推薦理由:Mistral Small 3 將 24B 參數、Apache 2.0 開放權重和低延遲定位放在同一發佈中,並提供本地量化運行條件,便於比較小型模型的部署選擇。
OpenMOSS 開源端到端語音對話大模型 SpeechGPT 2.0-preview,實測延遲在 200ms 以內,支援實時打斷交互。模型以百萬小時級真實語音數據訓練,目前只使用中文語音數據,尚未具備英文對話能力。
Hugging Face 發佈 SmolVLM-256M 與 SmolVLM-500M 兩款視覺語言模型。兩款模型各有 base 及 instruction fine-tuned checkpoints,支援 Transformers、MLX 和 ONNX,另有 WebGPU 示範。
推薦理由:文章交代兩款模型的定位,以及較小視覺編碼器和 tokenization 調整等設計取捨,呈現小型 VLM 如何兼顧效率與多模態能力。
Hugging Face Blog 公開兩款靜態嵌入模型,稱其 CPU 推理比常見嵌入模型快 100 至 400 倍,且多項基準保留至少 85% 表現。
推薦理由:文章公開兩款模型的訓練配方與資料集,並以 NanoBEIR 結果呈現靜態嵌入模型在 CPU 速度與檢索品質間的取捨。
Mistral AI 發佈程式碼模型 Codestral 25.01,稱其架構和 tokenizer 經改進,生成及補全程式碼的速度約為原版 2 倍。在所列基準中,Codestral-2501 的 HumanEvalFIM 平均分為 85.9%,高於 Codestral-2405 的 82.1%。
推薦理由:文中列出 Codestral 25.01 與舊版及其他模型的程式基準,並交代速度變化和部署入口,便於對照補全表現與採用方式。
DeepSeek 將 deepseek-chat 模型升級為 DeepSeek-V3,API 保持不變。使用者仍可透過指定 model='deepseek-chat' 調用 DeepSeek-V3。
推薦理由:這次更新交代 DeepSeek-V3 與既有 API 調用方式的關係,使用者仍可指定 deepseek-chat 調用新模型,便於沿用現有接入方式。
OpenAI 為 o1 模型引入新的審議式對齊策略,直接教授模型安全規範及如何據此推理。這項策略透過推理提升語言模型安全性。
Answer.AI 與 LightOn 發佈 ModernBERT,提供 base(149M params)及 large(395M params)兩種僅編碼器版本。
推薦理由:文章將 ModernBERT 的架構、效率與訓練改動連結至長上下文檢索及程式碼檢索場景,呈現編碼器更新對實際應用的意義。
IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。
推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。
OpenAI 發佈 o1,並公佈面向開發者的多項更新。內容包括 Realtime API 改進和一種新的微調方法。
推薦理由:公告將 o1、Realtime API 改進與新微調方法一併面向開發者呈現,可用來把握 OpenAI 此次更新涵蓋的模型與開發工具範圍。
Technology Innovation Institute(TII)發佈 Falcon3 開放模型系列,推出 Falcon3-1B-Base、Falcon3-3B-Base、Falcon3-7B-Base、Falcon3-10B-Base 及 Falcon3-Mamba-7B-Base 五款基礎模型。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2.5-1210,並改善多項能力。MATH-500 成績由 74.8% 提升至 82.8%,LiveCodebench(08.01 - 12.01)準確率由 29.2% 升至 34.38%;內部測試亦顯示寫作和推理有所改善。新版本亦優化檔案上傳和網頁摘要功能的使用體驗。
Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。
推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。
Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。
推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。
Mistral AI 發佈 Pixtral Large,一款基於 Mistral Large 2 的 124B 開放權重多模態模型,支援 128K 上下文窗口。
推薦理由:Pixtral Large 在 MathVista 得分 69.4%,並於 ChartQA、DocVQA 超越 GPT-4o 和 Gemini-1.5 Pro;這些結果提供數學視覺推理、圖表與文件理解的具體比較參照。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。
推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。
Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。
推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。
Mistral AI 發佈 Pixtral 12B,這款多模態模型採用基於 Mistral Nemo 的 12B 參數解碼器,以及從零訓練的 400M 參數視覺編碼器。它支援不同尺寸與長寬比的圖像,並可在 128K tokens 上下文窗口中處理多張圖片;在 MMMU 推理基準上取得 52.5%。模型採用 Apache 2.0 授權,可透過 Le Chat 或 La Plateforme 試用。
推薦理由:Mistral AI 以相同評測流程比較 Pixtral 12B 與多個開源及閉源模型,並列出 MMMU 52.5% 等基準結果,便於理解其多模態表現。
OpenAI 推出 o1。
DeepSeek 將 DeepSeek V2 Chat 與 DeepSeek Coder V2 合併升級為 DeepSeek V2.5。
阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。
推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。
推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。
DeepSeek 將 deepseek-coder 模型升級至 DeepSeek-Coder-V2-0724。這項升級記錄於 DeepSeek API 更新日誌。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
GPT-4o mini 旨在推動更具成本效益的智能。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。
推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。
Mistral AI 發佈 Mathstral,這款以 Mistral 7B 為基礎、專攻 STEM 的模型面向複雜數學推理。Mathstral 7B 在 MATH 得分 56.6%、MMLU 得分 63.47%;加入多數投票後,MATH 得分為 68.37%,使用強力獎勵模型並在 64 個候選項中評選時為 74.59%。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0628,並稱模型的推理能力有所提升。HumanEval Pass@1 由 79.88% 升至 84.76%,MATH ACC@1 由 55.02% 升至 71.02%,BBH 由 78.56% 升至 83.40%。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。
DeepSeek 將 deepseek-coder 升級至 DeepSeek-Coder-V2-0614,編碼能力顯著提升。其程式碼生成、理解、除錯及補全能力達到 GPT-4-Turbo-0409 水平,數學與推理能力出色,通用能力則與 DeepSeek-V2-0517 相當。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
OpenAI 進一步説明文字轉語音模型 Voice Engine 的運作方式,並分享相關安全研究。內容聚焦於 Voice Engine 背後的技術。
Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。
推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。