跳到正文

模型發佈

新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。

194條精選相關主題產品更新論文研究開源生態

最新精選

第 121–140 條 · 共 194 條
3月12日週三
  1. Hugging Face Blog78

    Google 發佈 Gemma 3 開放權重模型,4B、12B、27B 版支援圖像、140+ 種語言及 128k tokens 上下文

    Google 發佈 Gemma 3 開放權重模型系列,提供 1B、4B、12B、27B 四種規模及預訓練、指令微調版本。4B、12B、27B 版本支援圖像和文字、140+ 種語言及 128k tokens 上下文;1B 版本僅支援文字和英文,提供 32k 上下文。

    推薦理由:文章整理 Gemma 3 各版本的上下文、圖像與語言支援差異,並列出 Transformers、MLX 和 llama.cpp 的推理入口,方便比較使用路徑。

3月4日週二
  1. Hugging Face Blog69

    深入解析 Aya Vision:多語言多模態模型的技術設計與評測

    Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。

    推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。

2月27日週四
2月21日週五
  1. Hugging Face Blog63

    Google 發佈 SigLIP 2 多語言視覺語言編碼器系列

    Google 發佈 SigLIP 2 多語言視覺語言編碼器系列,加入新的訓練目標以提升語義理解、定位及密集特徵表現。訓練加入圖像描述與區域定位解碼器、自蒸餾的 Global-Local Loss 和 Masked Prediction Loss,並提供動態解析度 naflex 版本。

    推薦理由:SigLIP 2 把解碼器監督、自蒸餾與遮罩預測納入訓練,並提供動態解析度版本,展示提升局部語義表徵與適應不同長寬比的訓練思路。

2月20日週四
  1. Hugging Face Blog68

    SmolVLM2 將影片理解帶到各類裝置

    Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。

    推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。

1月30日週四
1月23日週四
  1. Hugging Face Blog67

    SmolVLM 推出 256M 與 500M 視覺語言模型

    Hugging Face 發佈 SmolVLM-256M 與 SmolVLM-500M 兩款視覺語言模型。兩款模型各有 base 及 instruction fine-tuned checkpoints,支援 Transformers、MLX 和 ONNX,另有 WebGPU 示範。

    推薦理由:文章交代兩款模型的定位,以及較小視覺編碼器和 tokenization 調整等設計取捨,呈現小型 VLM 如何兼顧效率與多模態能力。

1月15日週三
1月13日週一
  1. Mistral AI64

    Mistral AI 發佈 Codestral 25.01,程式碼生成及補全速度約提升 2 倍

    Mistral AI 發佈程式碼模型 Codestral 25.01,稱其架構和 tokenizer 經改進,生成及補全程式碼的速度約為原版 2 倍。在所列基準中,Codestral-2501 的 HumanEvalFIM 平均分為 85.9%,高於 Codestral-2405 的 82.1%。

    推薦理由:文中列出 Codestral 25.01 與舊版及其他模型的程式基準,並交代速度變化和部署入口,便於對照補全表現與採用方式。

12月26日週四
12月19日週四
12月18日週三
  1. Hugging Face Blog67

    Bamba-9B 混合 Mamba2 模型發佈,vLLM 測試吞吐量最高達 Meta Llama 3.1 8B 的 2.5 倍

    IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。

    推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。

12月17日週二
12月9日週一
  1. OpenAI News88

    OpenAI 影片生成模型 Sora 現已可在 sora.com 使用

    OpenAI 的影片生成模型 Sora 現已可在 sora.com 使用,支援生成最高 1080p、最長 20 秒的影片。影片可採寬屏、直向或正方形畫幅;用户可用自備素材延展、改編或混合影片,也可單憑文字生成全新內容。

    推薦理由:Sora 的可用入口及生成規格清晰列出,涵蓋影片時長、解像度、畫幅選擇,以及文字生成和自備素材改編等方式。

12月5日週四
  1. Hugging Face Blog61

    Google 發佈 PaliGemma 2 視覺語言模型

    Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。

    推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。

11月26日週二
  1. Hugging Face Blog66

    Hugging Face 發佈 2B 視覺語言模型系列 SmolVLM,開放模型與訓練流程

    Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。

    推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。

11月18日週一
10月24日週四
10月22日週二
10月16日週三
  1. Mistral AI65

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B 邊緣模型

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。

    推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。