Mistral AI 發佈 Codestral 25.08,並推出企業級完整編碼技術棧
Mistral AI 發佈 Codestral 25.08,並推出整合程式碼補全、語意檢索、Devstral 智能體工作流及 Mistral Code IDE 外掛的企業編碼技術棧。
推薦理由:文章把 Codestral 25.08、程式碼檢索、Devstral 智能體工作流與 IDE 管理整合為企業方案,並交代部署選項及安全治理設計。
新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。
Mistral AI 發佈 Codestral 25.08,並推出整合程式碼補全、語意檢索、Devstral 智能體工作流及 Mistral Code IDE 外掛的企業編碼技術棧。
推薦理由:文章把 Codestral 25.08、程式碼檢索、Devstral 智能體工作流與 IDE 管理整合為企業方案,並交代部署選項及安全治理設計。
Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。
推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。
Mistral AI 發佈 Voxtral 語音理解模型,提供 24B 生產級版本及 3B 本地與邊緣部署版本。兩者均以 Apache 2.0 授權發布,並可透過 API 使用;32k token 上下文支援最長 30 分鐘音訊轉錄或 40 分鐘音訊理解,也可對音訊提問及生成摘要。API 價格由每分鐘 $0.001 起。
推薦理由:Voxtral 同時提供 24B 與 3B 版本及 API 使用方式,並列出音訊時長上限和起始價格,方便比較本地部署與雲端接入的適用情境。
Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。
推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。
Hugging Face 發佈 3B 模型 SmolLM3,使用 11.2T tokens 訓練,支援 think / no_think 雙模式推理及最高 128k 上下文。
推薦理由:SmolLM3 公開分階段訓練、長上下文適配與雙模式推理配方,並交代數據配比和模型合併流程,呈現 3B 模型的工程實作路徑。
Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。
推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。
Mistral AI 發佈首款推理模型 Magistral,包含 24B 參數的開放權重版 Magistral Small 及企業版 Magistral Medium。
推薦理由:AIME2024 成績呈現兩版差異,Magistral Medium 和 Small 分別得 73.6% 和 70.7%,majority voting @64 時為 90% 和 83.3%。
Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。
推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。
DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,並公佈多項基準的 Pass@1 提升。AIME 2025 由 70.0 升至 87.5(+17.5),GPQA 由 71.5 升至 81.0(+9.5),LCB_v6 由 63.5 升至 73.3(+9.8),Aider 由 57.0 升至 71.6(+14.6)。
推薦理由:DeepSeek-R1-0528公佈多項基準提升數據,並提示複雜推理任務較舊版消耗更多 tokens,可供比較版本能力表現與用量。
Mistral AI 發佈與 All Hands AI 合作打造的 Devstral,這款面向軟件工程任務的智能體大語言模型以 Apache 2.0 授權免費開源。
推薦理由:Devstral 在 SWE-Bench Verified 得分 46.8%,較此前開源 SoTA 高逾 6 個百分點,讓模型處理真實 GitHub issue 的基準表現有量化參照。
Falcon-LLM Team 發佈 Falcon-H1 開放權重混合架構模型系列,涵蓋六種規模、由 0.5B 至 34B,並提供 base 與 instruction-tuned 版本。
推薦理由:文中對照 Qwen2.5-32B 的短、長上下文吞吐,並説明混合 Attention-SSM 設計,呈現 Falcon-H1 隨序列長度變化的效率取捨。
Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。
推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。
Meta 發佈 Llama Guard 4 多模態安全模型,以及兩款用於偵測提示詞注入和越獄的 Llama Prompt Guard 2 分類器,參數量分別為 86M 和 22M。
推薦理由:文章交代 Llama Guard 4 的圖文審核範圍與單張 24 GB VRAM GPU 部署條件,並附 Llama Prompt Guard 2 分類器規格及使用示例。
OpenAI 宣佈其最新圖像生成模型 gpt-image-1 現已可透過 API 使用。開發者與企業可將可自訂的專業級視覺內容直接整合至自有工具與平台。
推薦理由:材料交代 gpt-image-1 已可透過 API 使用,並指出開發者與企業可將可自訂的專業級視覺內容直接整合到自有工具與平台。
OpenAI 發佈 o3 和 o4-mini,稱兩者是其迄今最智能、能力最強的模型,並提供完整工具存取權限。
OpenAI 將 GPT-4.1 新模型系列引入 API,並同步推出首款 nano 模型。OpenAI 表示,該系列整體有所改進,尤其在編碼、指令遵循和長上下文理解方面提升顯著,並即日起向全球開發者開放。
推薦理由:公告列出 API 開放時間、改進方向及 nano 型號,讓開發者掌握此次 GPT-4.1 更新的發布範圍。
Hugging Face 將 Llama 4 Maverick (~400B) 與 Scout (~109B) 的權重上架 Hub,並宣佈 Transformers 與 TGI 支援。
推薦理由:文章整理了長上下文所用的 NoPE、分塊注意力與 temperature tuning 設計,讓讀者瞭解 Llama 4 延伸上下文窗口的架構取捨。
DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。
推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。
Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。
推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。