跳到正文

模型發佈

新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。

194條精選相關主題產品更新論文研究開源生態

最新精選

第 161–180 條 · 共 194 條
4月18日週四
  1. Hugging Face Blog86

    Meta 發佈 Llama 3 開源大語言模型,提供 8B 和 70B 版本

    Meta 發佈開源大語言模型 Llama 3,提供 8B、70B 兩種參數規模,各有 base 與指令微調版本。模型上下文窗口為 8K tokens,另有以 Llama 3 8B 微調的 Llama Guard 2;授權允許再分發、微調和衍生作品,並要求衍生模型名稱以 Llama 3 開頭,衍生作品或服務標示 Built with Meta Llama 3。

    推薦理由:文章梳理了 Llama 3 的型號、授權要求,以及 Hugging Face 上的推理部署和微調入口,呈現從模型取得到實際使用的主要路徑。

4月17日週三
  1. Mistral AI77

    Mistral AI 發佈 Mixtral 8x22B 開放模型

    Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。

    推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。

4月15日週一
  1. Hugging Face Blog71

    Hugging Face 發佈 8B 多模態模型 Idefics2,採 Apache-2.0 授權

    Hugging Face 發佈 Idefics2,這款 8B 參數多模態模型可接收文字與圖像序列並生成文字回應。模型權重採 Apache-2.0 授權,並已整合至 Transformers,支援圖像問答、OCR、圖表與文件理解。團隊亦公開 The Cauldron,收錄 50 個人工整理、供多輪對話使用的資料集。

    推薦理由:Idefics2 同時公開 8B 權重、Apache-2.0 授權與多項視覺問答基準成績,便於對照小型多模態模型的效能表現和使用條件。

4月14日週日
4月9日週二
  1. Hugging Face Blog64

    Google 發佈程式碼大語言模型 CodeGemma

    Google 發佈面向程式碼的大語言模型家族 CodeGemma,推出 2B base、7B base 和 7B instruct 三種版本。模型以 Gemma checkpoint 為基礎,額外訓練 500 billion tokens,三款模型均採用 8K token 上下文窗口。

    推薦理由:文章交代 CodeGemma 三種版本的用途,並列出 HumanEval 表現及 Hugging Face 的部署與量化整合,方便比較版本定位、基準表現和使用路徑。

2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。

2月26日週一
  1. Mistral AI79

    Mistral AI 發佈 Mistral Large、Mistral Small,並將 Mistral Large 接入 Azure

    Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。

    推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。

2月21日週三
  1. Hugging Face Blog78

    Google 發佈開放大語言模型 Gemma,Hugging Face 提供整合支援

    Google 發佈 Gemma 開放大語言模型系列,提供 2B、7B 兩種規模,各有基礎版與指令微調版,所有版本的上下文窗口為 8K tokens。Hugging Face 將模型上架 Hub,整合 Transformers 4.38、Google Cloud 和 Inference Endpoints,並提供以 TRL 微調的示例。

    推薦理由:文中將 Gemma 2B、7B 基礎模型與其他開放模型的 LLM Leaderboard 成績並列,呈現其不同參數規模下的相對表現。

2月15日週四
  1. OpenAI News77

    OpenAI 探討影片生成模型作為世界模擬器,並介紹 Sora

    OpenAI 訓練文字條件式擴散模型,最大模型 Sora 可生成一分鐘高保真影片。模型在不同時長、解析度和長寬比的影片與圖像上聯合訓練,並以 Transformer 架構處理影片和圖像的時空區塊及潛在編碼。研究結果認為,擴大影片生成模型規模是構建通用物理世界模擬器的一條有前景路徑。

    推薦理由:文章交代影片與圖像的聯合訓練方式及時空區塊架構,並呈現 OpenAI 將影片生成規模化連結至物理世界模擬器的研究思路。

12月11日週一
11月6日週一
9月27日週三
  1. Mistral AI79

    Mistral AI 推動開放 AI 模型邁向前沿,並介紹 Mistral 7B

    Mistral AI 發佈 Mistral 7B,這是其首個 7B-parameter 模型;公司稱該模型在所有標準英文及代碼基準上,超越所有目前可用、參數量不超過 13B 的開放模型。

    推薦理由:Mistral 7B 的比較對象涵蓋不超過 13B 參數的可用開放模型,文章亦交代 Apache 2.0 授權,便於一併理解其基準定位與開放使用方式。

  2. Mistral AI84

    Mistral AI 發佈 7.3B 參數模型 Mistral 7B

    Mistral AI 發佈 7.3B 參數的 Mistral 7B,稱其在多項基準測試中勝過或追平 Llama 2 13B。模型以 Apache 2.0 授權發佈,團隊亦提供使用公開指令數據微調的 Mistral 7B Instruct 聊天版。

    推薦理由:文章以重跑評測比較 Mistral 7B 與 Llama 系列,並説明 SWA 如何降低長序列的推理計算與快取成本。

8月25日週五
  1. Hugging Face Blog80

    Code Llama 推出 7B、13B、34B 參數規模的編碼模型

    Code Llama 推出 7B、13B 和 34B 參數版本,是以 Llama 2 為基礎、專攻編碼任務的模型家族。基礎模型以 500 billion tokens 的程式碼資料訓練,另有 Python 專用版和指令微調版;模型採用與 Llama 2 相同的社羣授權,可商用。

    推薦理由:文章並列 7B、13B、34B 參數規模、Python 與指令微調變體,以及 Hugging Face 接入方式,便於比較模型選擇和部署路徑。

8月22日週二
  1. Hugging Face Blog69

    Hugging Face 發佈 IDEFICS,開放復現 Flamingo 視覺語言模型

    Hugging Face 發佈 IDEFICS,作為 Flamingo 的開放取用復現模型,可接收圖像與文字序列並生成文字。模型提供 9B 和 80B 規模及對話用途的 instruct 版本,訓練資料包括 Wikipedia、Public Multimodal Dataset、LAION 和 115B tokens 的 OBELICS。

    推薦理由:IDEFICS 同時交代訓練資料、互動式資料集瀏覽工具、對抗提示評估與基礎模型授權,呈現開放多模態模型的建構和使用邊界。

7月18日週二
  1. Hugging Face Blog86

    Meta 發佈 Llama 2,12 個模型上架 Hugging Face Hub

    Meta 發佈 Llama 2 開放存取大語言模型系列,涵蓋 7B、13B 和 70B 參數規模,採用允許商業用途的社羣授權。Hugging Face Hub 上架 12 個模型,並整合 Transformers、Text Generation Inference 和 Inference Endpoints。

    推薦理由:文中把 Llama 2 的商用授權與 Hugging Face 上的推理、部署和 QLoRA 微調方法連在一起,呈現從取得模型到接入開發流程的實用路徑。

4月5日週三
  1. Hugging Face Blog78

    StackLLaMA:以 RLHF 訓練 LLaMA 的實作指南

    Hugging Face 發佈 StackLLaMA,這是一個以 LLaMA 7B 為基礎、經 RLHF 微調、用於回答 Stack Exchange 問題的模型;完整訓練流程納入 Hugging Face TRL library。文章逐步示範監督式微調、獎勵模型訓練及 PPO 強化學習,並介紹 Stack Exchange 數據的偏好評分與 LoRA 等記憶體效率方法。

    推薦理由:文章串聯 SFT、偏好獎勵模型與 PPO 三階段,並示範以 8-bit 載入和 LoRA 降低 RLHF 微調的記憶體需求,呈現可復用的訓練流程。

3月14日週二
  1. OpenAI News87

    OpenAI 發佈 GPT-4 多模態模型

    OpenAI 發佈 GPT-4,這是一款可接收圖像和文字輸入、輸出文字的大型多模態模型。它在多項專業及學術基準上達到人類水平表現,但在許多真實場景中的能力仍不及人類。

    推薦理由:材料同時交代 GPT-4 的圖像與文字輸入、文字輸出形式,以及基準表現和真實場景能力的差異,可幫助讀者把握其能力描述的範圍。

3月6日週一
11月30日週三
  1. OpenAI News93

    OpenAI 介紹對話模型 ChatGPT

    OpenAI 介紹了名為 ChatGPT 的對話模型,該模型以對話方式與用户互動。對話格式使 ChatGPT 能回答追問、承認錯誤、質疑不正確前提,並拒絕不當請求。

    推薦理由:原文把追問、承認錯誤、質疑錯誤前提及拒絕不當請求列為對話格式支持的行為,具體呈現 ChatGPT 的互動設計。