跳到正文

開源生態

開源模型、框架與倉庫動態:權重開放、社區項目爆火、開源與閉源的力量消長。

117條精選相關主題模型發佈Hugging FaceAI 編碼

最新精選

第 81–100 條 · 共 117 條
5月21日週二
4月18日週四
  1. Hugging Face Blog86

    Meta 發佈 Llama 3 開源大語言模型,提供 8B 和 70B 版本

    Meta 發佈開源大語言模型 Llama 3,提供 8B、70B 兩種參數規模,各有 base 與指令微調版本。模型上下文窗口為 8K tokens,另有以 Llama 3 8B 微調的 Llama Guard 2;授權允許再分發、微調和衍生作品,並要求衍生模型名稱以 Llama 3 開頭,衍生作品或服務標示 Built with Meta Llama 3。

    推薦理由:文章梳理了 Llama 3 的型號、授權要求,以及 Hugging Face 上的推理部署和微調入口,呈現從模型取得到實際使用的主要路徑。

4月17日週三
  1. Mistral AI77

    Mistral AI 發佈 Mixtral 8x22B 開放模型

    Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。

    推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。

4月15日週一
  1. Hugging Face Blog71

    Hugging Face 發佈 8B 多模態模型 Idefics2,採 Apache-2.0 授權

    Hugging Face 發佈 Idefics2,這款 8B 參數多模態模型可接收文字與圖像序列並生成文字回應。模型權重採 Apache-2.0 授權,並已整合至 Transformers,支援圖像問答、OCR、圖表與文件理解。團隊亦公開 The Cauldron,收錄 50 個人工整理、供多輪對話使用的資料集。

    推薦理由:Idefics2 同時公開 8B 權重、Apache-2.0 授權與多項視覺問答基準成績,便於對照小型多模態模型的效能表現和使用條件。

4月10日週三
  1. Hugging Face Blog64

    Hugging Face 推出 Deploy on Google Cloud,讓開放模型可部署至 Vertex AI 和 GKE

    Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。

    推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。

3月20日週三
2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。

2月21日週三
  1. Hugging Face Blog78

    Google 發佈開放大語言模型 Gemma,Hugging Face 提供整合支援

    Google 發佈 Gemma 開放大語言模型系列,提供 2B、7B 兩種規模,各有基礎版與指令微調版,所有版本的上下文窗口為 8K tokens。Hugging Face 將模型上架 Hub,整合 Transformers 4.38、Google Cloud 和 Inference Endpoints,並提供以 TRL 微調的示例。

    推薦理由:文中將 Gemma 2B、7B 基礎模型與其他開放模型的 LLM Leaderboard 成績並列,呈現其不同參數規模下的相對表現。

2月19日週一
2月8日週四
12月11日週一
10月27日週五
9月27日週三
  1. Mistral AI79

    Mistral AI 推動開放 AI 模型邁向前沿,並介紹 Mistral 7B

    Mistral AI 發佈 Mistral 7B,這是其首個 7B-parameter 模型;公司稱該模型在所有標準英文及代碼基準上,超越所有目前可用、參數量不超過 13B 的開放模型。

    推薦理由:Mistral 7B 的比較對象涵蓋不超過 13B 參數的可用開放模型,文章亦交代 Apache 2.0 授權,便於一併理解其基準定位與開放使用方式。

  2. Mistral AI84

    Mistral AI 發佈 7.3B 參數模型 Mistral 7B

    Mistral AI 發佈 7.3B 參數的 Mistral 7B,稱其在多項基準測試中勝過或追平 Llama 2 13B。模型以 Apache 2.0 授權發佈,團隊亦提供使用公開指令數據微調的 Mistral 7B Instruct 聊天版。

    推薦理由:文章以重跑評測比較 Mistral 7B 與 Llama 系列,並説明 SWA 如何降低長序列的推理計算與快取成本。

8月23日週三
  1. Hugging Face Blog76

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。

    推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。

7月24日週一
7月18日週二
  1. Hugging Face Blog86

    Meta 發佈 Llama 2,12 個模型上架 Hugging Face Hub

    Meta 發佈 Llama 2 開放存取大語言模型系列,涵蓋 7B、13B 和 70B 參數規模,採用允許商業用途的社羣授權。Hugging Face Hub 上架 12 個模型,並整合 Transformers、Text Generation Inference 和 Inference Endpoints。

    推薦理由:文中把 Llama 2 的商用授權與 Hugging Face 上的推理、部署和 QLoRA 微調方法連在一起,呈現從取得模型到接入開發流程的實用路徑。

7月5日週三
  1. Hugging Face Blog62

    如何用 Transformers.js 製作即時機器學習網頁遊戲 Doodle Dash

    Hugging Face Blog 作者以 Transformers.js 製作 Doodle Dash,並示範如何構建可在瀏覽器本地運行的即時機器學習遊戲。遊戲模型以 Google Quick, Draw!

    推薦理由:文章串連 Quick, Draw! 數據微調、ONNX 轉換與 Transformers.js 瀏覽器推理,呈現把圖像分類模型接入即時網頁遊戲的實作路徑。

5月23日週二
4月5日週三
  1. Hugging Face Blog78

    StackLLaMA:以 RLHF 訓練 LLaMA 的實作指南

    Hugging Face 發佈 StackLLaMA,這是一個以 LLaMA 7B 為基礎、經 RLHF 微調、用於回答 Stack Exchange 問題的模型;完整訓練流程納入 Hugging Face TRL library。文章逐步示範監督式微調、獎勵模型訓練及 PPO 強化學習,並介紹 Stack Exchange 數據的偏好評分與 LoRA 等記憶體效率方法。

    推薦理由:文章串聯 SFT、偏好獎勵模型與 PPO 三階段,並示範以 8-bit 載入和 LoRA 降低 RLHF 微調的記憶體需求,呈現可復用的訓練流程。