跳到正文

模型發佈

新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。

194條精選相關主題產品更新論文研究開源生態

最新精選

第 21–40 條 · 共 194 條
9月3日週四
  1. Google DeepMind75

    Google DeepMind 與 Google Research 發佈 WeatherNext 3 全球天氣 AI 模型

    Google DeepMind 與 Google Research 發佈 WeatherNext 3,利用即時地球同步衞星資料逐小時生成全球天氣預報,部分地表變數解析度達 5 公里。

    推薦理由:WeatherNext 3 以即時衞星觀測支援逐小時全球預報,並為部分變數提供 5 公里解析度;文中列出降水預測相對 IMERG、MRMS 等基線的 CRPS 改善幅度。

  2. OpenAI News74

    GPT-6 Astra 安全概覽:網絡安全能力達 Preparedness Framework 的 Critical 級別

    OpenAI 的 GPT-6 Astra 安全概覽指出,該模型是其目前廣泛部署中能力最強的模型。它也是首個在 Preparedness Framework 下達到網絡安全能力 Critical 級別的模型。

    推薦理由:這段安全概覽同時交代 GPT-6 Astra 的部署定位與網絡安全能力級別,可供讀者把模型能力描述放回 Preparedness Framework 的評估框架理解。

8月27日週四
  1. Google DeepMind69

    Google DeepMind 發佈 Gemini 3.5 Transcribe 語音轉文字模型

    Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。

    推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。

8月14日週五
8月12日週三
8月10日週一
  1. Hugging Face Blog77

    Meta 發佈 Muse Glimmer 30B 多模態模型,採用 Apache 2.0 授權並面向本地智能體應用

    Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。

    推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。

8月6日週四
  1. OpenAI News73

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,並擴大免費用户使用 GPT-5.6 Luna 的範圍

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。

    推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。

8月4日週二
  1. Mistral AI62

    Mistral AI 發佈 3B 多模態安全分類器 Shieldstral

    Mistral AI 發佈 Shieldstral,一款 3B 開放權重多模態安全分類器,可用自然語言政策評估文字與圖像,無須重新訓練。它將內容審核設計為可在推理時指定政策的二元問答,並輸出校準後的安全分數;Mistral 稱其在多項基準上匹配或超越模型規模最高達其 7x 的開放權重安全模型。

    推薦理由:將審核政策置於推理時的自然語言問題中,使同一個 3B 模型可按部署情境調整文字與圖像判斷,無須重新訓練。

7月30日週四
  1. Google DeepMind66

    Google DeepMind 發佈 Gemini Robotics ER 2,支援影片理解、任務編排與多機械人協作

    Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。

    推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。

7月28日週二
  1. Google DeepMind69

    Gemini Robotics 2 為機械人帶來全身智能控制

    Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。

    推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。

7月21日週二
7月17日週五
  1. Google DeepMind65

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber 網絡安全模型

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。

    推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。

7月2日週四
7月1日週三
6月23日週二
  1. Mistral AI60

    Mistral OCR 4 發佈,新增文件區塊定位、分類與信心分數

    Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。

    推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。

6月17日週三
  1. Hugging Face Blog78

    GLM-5.2 發佈,最大上下文擴至 1M tokens並提升長程任務能力

    GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。

    推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。

6月11日週四
6月9日週二
  1. Google DeepMind72

    Google DeepMind 發佈 Gemma 4 12B 統一免編碼器多模態模型

    Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。

    推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。