跳到正文

#開源生態

今日 7 條
7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

7月10日週三
  1. Hugging Face Blog65

    Hugging Face 與 KerasHub 宣佈共用模型保存格式

    Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。

    推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。

6月27日週四
  1. Hugging Face Blog79

    Google 發佈開放式大語言模型 Gemma 2

    Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。

    推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。

6月7日週五
  1. Hugging Face Blog40

    Hugging Face 計劃重設 Transformers 文件,改採以開發者為先的架構

    Hugging Face 計劃重新設計 Transformers 文件,令內容更貼合開發者需要,並改善導覽與內容整合。文件原為機器學習工程師與研究人員而寫,後隨文本、LLM及優化等階段逐步擴充,造成內容分散、結構僵化和導覽困難。重設方向是以程式碼示例和解決方案為先,結合初階機器學習概念,並採用可自然擴展的靈活架構。

5月24日週五
  1. Hugging Face Blog58

    Falcon 2 發佈 11B LLM 與 11B VLM,LLM 以逾 5000B tokens 訓練並涵蓋 11 種語言

    TII 發佈 Falcon 2 系列的 11B LLM 與 11B VLM,VLM 可接收圖像並回答相關問題。LLM 使用逾 5000B tokens 訓練,主要支援英語,並對另外 10 種語言具備良好能力。VLM 結合 CLIP ViT-L/14 視覺編碼器,先以 558K 圖像描述配對訓練多模態投影器,再以 1.2M 圖像文字指令資料微調。

5月21日週二
4月23日週二
4月18日週四
  1. Hugging Face Blog86

    Meta 發佈 Llama 3 開源大語言模型,提供 8B 和 70B 版本

    Meta 發佈開源大語言模型 Llama 3,提供 8B、70B 兩種參數規模,各有 base 與指令微調版本。模型上下文窗口為 8K tokens,另有以 Llama 3 8B 微調的 Llama Guard 2;授權允許再分發、微調和衍生作品,並要求衍生模型名稱以 Llama 3 開頭,衍生作品或服務標示 Built with Meta Llama 3。

    推薦理由:文章梳理了 Llama 3 的型號、授權要求,以及 Hugging Face 上的推理部署和微調入口,呈現從模型取得到實際使用的主要路徑。

4月17日週三
  1. Mistral AI77

    Mistral AI 發佈 Mixtral 8x22B 開放模型

    Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。

    推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。

4月15日週一
  1. Hugging Face Blog71

    Hugging Face 發佈 8B 多模態模型 Idefics2,採 Apache-2.0 授權

    Hugging Face 發佈 Idefics2,這款 8B 參數多模態模型可接收文字與圖像序列並生成文字回應。模型權重採 Apache-2.0 授權,並已整合至 Transformers,支援圖像問答、OCR、圖表與文件理解。團隊亦公開 The Cauldron,收錄 50 個人工整理、供多輪對話使用的資料集。

    推薦理由:Idefics2 同時公開 8B 權重、Apache-2.0 授權與多項視覺問答基準成績,便於對照小型多模態模型的效能表現和使用條件。

4月10日週三
  1. Hugging Face Blog64

    Hugging Face 推出 Deploy on Google Cloud,讓開放模型可部署至 Vertex AI 和 GKE

    Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。

    推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。

3月25日週一
  1. Hugging Face Blog41

    Pollen-Vision:機械人零樣本視覺模型的統一介面

    Pollen Robotics 推出開源 pollen-vision 函式庫,整合零樣本視覺模型,支援以影像和文字輸入建立物件偵測及分割流程。首批模型包括 OWL-VIT、Mobile Sam 和 RAM,並結合深度資訊估算物件在 3D 空間中的 (x, y, z) 位置,為機械人抓取提供基礎。目前尚未支援完整 6D 姿態估計,OWL-VIT 的偵測結果亦可能不一致。

3月20日週三
3月4日週一
2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。

2月21日週三
  1. Hugging Face Blog78

    Google 發佈開放大語言模型 Gemma,Hugging Face 提供整合支援

    Google 發佈 Gemma 開放大語言模型系列,提供 2B、7B 兩種規模,各有基礎版與指令微調版,所有版本的上下文窗口為 8K tokens。Hugging Face 將模型上架 Hub,整合 Transformers 4.38、Google Cloud 和 Inference Endpoints,並提供以 TRL 微調的示例。

    推薦理由:文中將 Gemma 2B、7B 基礎模型與其他開放模型的 LLM Leaderboard 成績並列,呈現其不同參數規模下的相對表現。

2月19日週一
2月8日週四
12月11日週一
11月7日週二
  1. Hugging Face Blog49

    推出 Prodigy-HF:與 Hugging Face 直接整合

    Explosion 推出 Prodigy-HF,將 Prodigy 與 Hugging Face 生態系直接整合,支援以標註資料訓練及重用 Hugging Face 模型。插件可透過命令列微調命名實體識別及文本分類模型,並將訓練模型儲存至磁碟後上載至 Hugging Face Hub。使用者亦可把已標註資料集發佈至 Hugging Face Hub,供社羣共享。

10月27日週五
9月27日週三
  1. Mistral AI79

    Mistral AI 推動開放 AI 模型邁向前沿,並介紹 Mistral 7B

    Mistral AI 發佈 Mistral 7B,這是其首個 7B-parameter 模型;公司稱該模型在所有標準英文及代碼基準上,超越所有目前可用、參數量不超過 13B 的開放模型。

    推薦理由:Mistral 7B 的比較對象涵蓋不超過 13B 參數的可用開放模型,文章亦交代 Apache 2.0 授權,便於一併理解其基準定位與開放使用方式。

  2. Mistral AI84

    Mistral AI 發佈 7.3B 參數模型 Mistral 7B

    Mistral AI 發佈 7.3B 參數的 Mistral 7B,稱其在多項基準測試中勝過或追平 Llama 2 13B。模型以 Apache 2.0 授權發佈,團隊亦提供使用公開指令數據微調的 Mistral 7B Instruct 聊天版。

    推薦理由:文章以重跑評測比較 Mistral 7B 與 Llama 系列,並説明 SWA 如何降低長序列的推理計算與快取成本。

8月23日週三
  1. Hugging Face Blog76

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。

    推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。

8月22日週二
  1. Hugging Face Blog57

    Hugging Face 推出企業程式碼助手方案 SafeCoder

    Hugging Face 推出 SafeCoder 企業程式碼助手方案,讓客户在自家基礎設施訓練及部署,程式碼於訓練和推理期間不離開 VPC。SafeCoder 初始版本以 StarCoder 為基礎,可按客户私有程式碼庫微調;程式碼補全建議會對照 The Stack,顯示其是否匹配資料集中的程式碼及相關授權。SafeCoder 與 VMware 合作推出,現向 VMware 企業客户提供。

8月1日週二
  1. Hugging Face Blog48

    Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及權重

    Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及預訓練權重;兩款模型參數量分別較基礎模型少 35% 和 55%,圖像保真度相若。兩者推理速度最高較基礎模型快 100%,預訓練檢查點可於 Hugging Face 取得。模型仍處早期階段,輸出未必達生產級,且在組合性與多概念生成方面表現有限。

7月24日週一
7月18日週二
  1. Hugging Face Blog86

    Meta 發佈 Llama 2,12 個模型上架 Hugging Face Hub

    Meta 發佈 Llama 2 開放存取大語言模型系列,涵蓋 7B、13B 和 70B 參數規模,採用允許商業用途的社羣授權。Hugging Face Hub 上架 12 個模型,並整合 Transformers、Text Generation Inference 和 Inference Endpoints。

    推薦理由:文中把 Llama 2 的商用授權與 Hugging Face 上的推理、部署和 QLoRA 微調方法連在一起,呈現從取得模型到接入開發流程的實用路徑。

7月5日週三
  1. Hugging Face Blog62

    如何用 Transformers.js 製作即時機器學習網頁遊戲 Doodle Dash

    Hugging Face Blog 作者以 Transformers.js 製作 Doodle Dash,並示範如何構建可在瀏覽器本地運行的即時機器學習遊戲。遊戲模型以 Google Quick, Draw!

    推薦理由:文章串連 Quick, Draw! 數據微調、ONNX 轉換與 Transformers.js 瀏覽器推理,呈現把圖像分類模型接入即時網頁遊戲的實作路徑。

7月4日週二
7月1日週六
6月12日週一
6月6日週二
6月1日週四
5月23日週二
4月24日週一
4月12日週三
  1. Hugging Face Blog51

    Substra 如何用聯邦學習構建保護私隱的 AI

    Hugging Face 與 Substra 合作製作互動空間,介紹聯邦學習如何在數據不離開本地的情況下協同訓練模型。Substra 是面向真實生產環境的開源聯邦學習框架,模型權重在多個伺服器間傳遞,讓研究者利用不同來源的數據訓練模型。空間可調整樣本分佈並觀察簡單模型的反應;文中稱,聯邦學習模型在驗證數據上的表現幾乎總是優於單一來源訓練的模型。

4月6日週四