跳到正文

開源生態

開源模型、框架與倉庫動態:權重開放、社區項目爆火、開源與閉源的力量消長。

117條精選相關主題模型發佈Hugging FaceAI 編碼

最新精選

第 61–80 條 · 共 117 條
3月18日週二
3月17日週一
  1. Mistral AI68

    Mistral Small 3.1 發佈,支援多模態理解與最高 128k tokens 上下文窗口

    Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。

    推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。

3月4日週二
  1. Hugging Face Blog69

    深入解析 Aya Vision:多語言多模態模型的技術設計與評測

    Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。

    推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。

1月30日週四
1月27日週一
  1. Hugging Face Blog69

    Diffusers 中開源影片生成模型的現況

    Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。

    推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。

12月18日週三
  1. Hugging Face Blog67

    Bamba-9B 混合 Mamba2 模型發佈,vLLM 測試吞吐量最高達 Meta Llama 3.1 8B 的 2.5 倍

    IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。

    推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。

12月9日週一
  1. Hugging Face Blog61

    Hugging Face 83 款開源模型現可在 Amazon Bedrock Marketplace 部署

    Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。

    推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。

12月2日週一
  1. Hugging Face Blog67

    Hugging Face 發佈 EU AI Act 開源開發者指南

    Hugging Face Blog 發佈 EU AI Act 開源開發者指南,梳理法規對 AI 系統及 GPAI 模型的適用範圍與分級義務。指南聚焦有限風險 AI 系統和非系統性風險開源 GPAI 模型,涵蓋披露 AI 互動、以機器可讀格式標記合成內容、提供訓練內容摘要及尊重版權 opt-out 等要求。

    推薦理由:文章區分有限風險 AI 系統與非系統性風險開源 GPAI 模型,梳理透明標示、訓練內容摘要及版權 opt-out 等合規要求。

11月26日週二
  1. Hugging Face Blog66

    Hugging Face 發佈 2B 視覺語言模型系列 SmolVLM,開放模型與訓練流程

    Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。

    推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。

10月24日週四
10月22日週二
  1. Hugging Face Blog75

    Transformers.js v3 發佈,加入 WebGPU 支援並將支援架構增至 120 種

    Hugging Face 發佈 Transformers.js v3,新增 WebGPU 支援和量化格式選擇,支援架構總數增至 120 種。官方稱 WebGPU 最高可比 WASM 快 100 倍;此版本另提供 25 個示例專案與範本,以及超過 1200 個已轉換模型。

    推薦理由:這次更新把 WebGPU、量化格式選擇及 120 種架構納入同一 JavaScript 庫,並兼容 Node.js、Deno、Bun,展示其瀏覽器與伺服器端部署路徑。

9月17日週二
8月12日週一
  1. Hugging Face Blog68

    TII 發佈 Falcon Mamba 7B 純 Mamba 模型

    阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。

    推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。

8月8日週四
  1. Hugging Face Blog68

    Hugging Face 收購 XetHub,計劃將其技術用於 Hub 儲存後端

    Hugging Face 宣佈收購 XetHub,並計劃以其技術替換 Hub 現有的 Git LFS 儲存後端。文中舉例,10GB Parquet 檔案新增一行時只需重傳少數區塊;未來修改 GGUF header 的單一 metadata 值,也只需重傳數 KB 的區塊。

    推薦理由:XetHub 的分塊與去重技術將用於 Hub 儲存後端,文中的 Parquet 和 GGUF 例子展示小幅修改如何減少大型檔案的重傳量。

7月31日週三
  1. Hugging Face Blog71

    Google 發佈 Gemma 2 2B、ShieldGemma 和 Gemma Scope

    Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。

    推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。

7月23日週二
  1. Hugging Face Blog87

    Meta 發佈 Llama 3.1,推出 8B、70B、405B 模型並支援多語言與 128K tokens 上下文

    Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。

    推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。

7月18日週四
  1. Mistral AI70

    Mistral AI 與 NVIDIA 合作發佈 Mistral NeMo 12B 模型,支援 128k tokens 上下文窗口

    Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。

    推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。

7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

7月10日週三
  1. Hugging Face Blog65

    Hugging Face 與 KerasHub 宣佈共用模型保存格式

    Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。

    推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。

6月27日週四
  1. Hugging Face Blog79

    Google 發佈開放式大語言模型 Gemma 2

    Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。

    推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。