跳到正文

模型發佈

新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。

194條精選相關主題產品更新論文研究開源生態

最新精選

第 101–120 條 · 共 194 條
7月30日週三
7月16日週三
  1. Hugging Face Blog68

    Ettin Suite 發佈 17M-1B 參數的配對編碼器與解碼器模型

    Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。

    推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。

7月15日週二
  1. Mistral AI77

    Mistral AI 發佈 Voxtral 語音理解模型

    Mistral AI 發佈 Voxtral 語音理解模型,提供 24B 生產級版本及 3B 本地與邊緣部署版本。兩者均以 Apache 2.0 授權發布,並可透過 API 使用;32k token 上下文支援最長 30 分鐘音訊轉錄或 40 分鐘音訊理解,也可對音訊提問及生成摘要。API 價格由每分鐘 $0.001 起。

    推薦理由:Voxtral 同時提供 24B 與 3B 版本及 API 使用方式,並列出音訊時長上限和起始價格,方便比較本地部署與雲端接入的適用情境。

7月11日週五
  1. Mistral AI67

    Mistral AI 發佈 Devstral Medium 和升級版 Devstral Small 1.1,強化智能體編碼能力

    Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。

    推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。

7月8日週二
6月26日週四
  1. Hugging Face Blog74

    Gemma 3n 全面接入主流開源工具庫,推出 E2B、E4B 尺寸模型

    Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。

    推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。

6月10日週二
6月3日週二
  1. Hugging Face Blog62

    Hugging Face 發佈 SmolVLA:基於 LeRobot 社羣數據訓練的 450M 開源 VLA 模型

    Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。

    推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。

5月28日週三
  1. DeepSeek:API 更新日誌76

    DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,推理基準分數提升

    DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,並公佈多項基準的 Pass@1 提升。AIME 2025 由 70.0 升至 87.5(+17.5),GPQA 由 71.5 升至 81.0(+9.5),LCB_v6 由 63.5 升至 73.3(+9.8),Aider 由 57.0 升至 71.6(+14.6)。

    推薦理由:DeepSeek-R1-0528公佈多項基準提升數據,並提示複雜推理任務較舊版消耗更多 tokens,可供比較版本能力表現與用量。

5月21日週三
5月7日週三
  1. Mistral AI67

    Mistral AI 發佈 Mistral Medium 3,主打效能、成本與企業部署

    Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。

    推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。

4月29日週二
4月23日週三
  1. OpenAI News70

    OpenAI 將 gpt-image-1 圖像生成模型接入 API

    OpenAI 宣佈其最新圖像生成模型 gpt-image-1 現已可透過 API 使用。開發者與企業可將可自訂的專業級視覺內容直接整合至自有工具與平台。

    推薦理由:材料交代 gpt-image-1 已可透過 API 使用,並指出開發者與企業可將可自訂的專業級視覺內容直接整合到自有工具與平台。

4月16日週三
4月14日週一
  1. OpenAI News71

    OpenAI 將 GPT-4.1 模型系列引入 API,並推出首款 nano 模型

    OpenAI 將 GPT-4.1 新模型系列引入 API,並同步推出首款 nano 模型。OpenAI 表示,該系列整體有所改進,尤其在編碼、指令遵循和長上下文理解方面提升顯著,並即日起向全球開發者開放。

    推薦理由:公告列出 API 開放時間、改進方向及 nano 型號,讓開發者掌握此次 GPT-4.1 更新的發布範圍。

4月5日週六
3月27日週四
  1. Hugging Face Blog77

    DeepSeek-V3 0324 登上 Hugging Face Hub,四項基準分數均上升

    DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。

    推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。

3月18日週二
3月17日週一
  1. Mistral AI68

    Mistral Small 3.1 發佈,支援多模態理解與最高 128k tokens 上下文窗口

    Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。

    推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。