Meta 發佈 Llama 3.2,涵蓋視覺模型與裝置端小型模型
Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。
推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。
新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。
Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。
推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。
Mistral AI 公佈多項更新,包括 Mistral Small v24.09、la Plateforme 免費層、模型降價及 le Chat 免費提供 Pixtral 12B 圖像理解。
推薦理由:免費層涵蓋開發者的實驗、評估與原型製作,價格表亦列出模型新舊費率及降幅,呈現試用門檻和 API 成本的變化。
Mistral AI 發佈 Pixtral 12B,這款多模態模型採用基於 Mistral Nemo 的 12B 參數解碼器,以及從零訓練的 400M 參數視覺編碼器。它支援不同尺寸與長寬比的圖像,並可在 128K tokens 上下文窗口中處理多張圖片;在 MMMU 推理基準上取得 52.5%。模型採用 Apache 2.0 授權,可透過 Le Chat 或 La Plateforme 試用。
推薦理由:Mistral AI 以相同評測流程比較 Pixtral 12B 與多個開源及閉源模型,並列出 MMMU 52.5% 等基準結果,便於理解其多模態表現。
OpenAI 推出 o1。
阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。
推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。
推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。
推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。
推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。
Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。
推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。
OpenAI 在 ChatGPT 免費提供 GPT-4o,並推出新的語音及影片模式。Sam Altman 形容新模式的回應速度和表達能力達到人類水平,令與電腦交談感覺自然。他亦提到,會加入可選的個人化、存取用户資訊及代用户採取行動等能力。
推薦理由:文章並列 GPT-4o 免費提供與新語音、影片模式,呈現 OpenAI 擴大高能力 AI 使用範圍和改善人機互動的兩個方向。
OpenAI 宣佈 GPT-4 Omni(GPT-4o)為新的旗艦模型。該模型可即時跨音訊、視覺和文字進行推理。
推薦理由:公告把 GPT-4o 定位為新旗艦模型,並明確列出音訊、視覺和文字的即時推理能力,讓讀者掌握此次宣佈的多模態重點。
OpenAI 在春季更新中推出 GPT-4o,並在 ChatGPT 中免費開放更多能力。
推薦理由:這次更新同時涵蓋 GPT-4o 的推出與 ChatGPT 免費可用能力的擴展,呈現新模型推出和免費使用安排兩方面的變化。
OpenAI 推出最新旗艦模型 GPT-4o,並在 ChatGPT 中向免費用户開放更多功能。
StarCoder2-15B-Instruct-v0.1 採用全透明、寬鬆授權的自對齊流程訓練,未使用人工標註或大型專有 LLM 的蒸餾數據。流程以 StarCoder2-15B 從 The Stack V1 的種子函數生成指令,並透過沙箱執行測試篩選回答,最終形成包含 50k 組指令與回答的 SFT 數據集。
推薦理由:文章梳理了從 The Stack V1 種子函數生成指令,再以執行測試篩選回答的自對齊流程,説明程式碼模型如何利用自身生成數據進行微調。