OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統
OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。
推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。
AI 寫代碼的一切:編碼助手、Vibe Coding、代碼模型評測與開發工作流變革。
OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。
推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。
Mistral AI 發佈 Codestral 25.08,並推出整合程式碼補全、語意檢索、Devstral 智能體工作流及 Mistral Code IDE 外掛的企業編碼技術棧。
推薦理由:文章把 Codestral 25.08、程式碼檢索、Devstral 智能體工作流與 IDE 管理整合為企業方案,並交代部署選項及安全治理設計。
Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。
推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。
Mistral AI 發佈與 All Hands AI 合作打造的 Devstral,這款面向軟件工程任務的智能體大語言模型以 Apache 2.0 授權免費開源。
推薦理由:Devstral 在 SWE-Bench Verified 得分 46.8%,較此前開源 SoTA 高逾 6 個百分點,讓模型處理真實 GitHub issue 的基準表現有量化參照。
Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。
推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。
OpenAI 將 GPT-4.1 新模型系列引入 API,並同步推出首款 nano 模型。OpenAI 表示,該系列整體有所改進,尤其在編碼、指令遵循和長上下文理解方面提升顯著,並即日起向全球開發者開放。
推薦理由:公告列出 API 開放時間、改進方向及 nano 型號,讓開發者掌握此次 GPT-4.1 更新的發布範圍。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Mistral AI 推出全新 le Chat AI 助手,面向生活與工作場景,並開始提供 iOS、Android 版本及 Pro、Team 方案。它支援網頁搜尋、文件上傳與摘要、圖像生成及沙盒程式碼執行;Flash Answers 預覽版向所有用户開放,速度最高可達 ~1000 words / sec。
推薦理由:le Chat 整合文件分析、Code interpreter、圖像生成與日常助理用途,並以免費、Pro、Team及企業私有部署方案覆蓋不同場景。
Mistral AI 發佈程式碼模型 Codestral 25.01,稱其架構和 tokenizer 經改進,生成及補全程式碼的速度約為原版 2 倍。在所列基準中,Codestral-2501 的 HumanEvalFIM 平均分為 85.9%,高於 Codestral-2405 的 82.1%。
推薦理由:文中列出 Codestral 25.01 與舊版及其他模型的程式基準,並交代速度變化和部署入口,便於對照補全表現與採用方式。
Answer.AI 與 LightOn 發佈 ModernBERT,提供 base(149M params)及 large(395M params)兩種僅編碼器版本。
推薦理由:文章將 ModernBERT 的架構、效率與訓練改動連結至長上下文檢索及程式碼檢索場景,呈現編碼器更新對實際應用的意義。
Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。
推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。
推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。
Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。
推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。
StarCoder2-15B-Instruct-v0.1 採用全透明、寬鬆授權的自對齊流程訓練,未使用人工標註或大型專有 LLM 的蒸餾數據。流程以 StarCoder2-15B 從 The Stack V1 的種子函數生成指令,並透過沙箱執行測試篩選回答,最終形成包含 50k 組指令與回答的 SFT 數據集。
推薦理由:文章梳理了從 The Stack V1 種子函數生成指令,再以執行測試篩選回答的自對齊流程,説明程式碼模型如何利用自身生成數據進行微調。
Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。
推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。
Google 發佈面向程式碼的大語言模型家族 CodeGemma,推出 2B base、7B base 和 7B instruct 三種版本。模型以 Gemma checkpoint 為基礎,額外訓練 500 billion tokens,三款模型均採用 8K token 上下文窗口。
推薦理由:文章交代 CodeGemma 三種版本的用途,並列出 HumanEval 表現及 Hugging Face 的部署與量化整合,方便比較版本定位、基準表現和使用路徑。
BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。
推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。
Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。
推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。
Hugging Face 示範以其 GitHub 組織內按 stargazers 排名前 10 的公開程式碼庫,微調 StarCoder 製作個人化程式碼助手 HugCoder。
推薦理由:文章示範以 Hugging Face 公開程式碼庫微調個人化程式碼助手,並對照 QLoRA 與全量微調的成本和 HumanEval 結果,呈現訓練資源與表現的取捨。