跳到正文

#模型發佈

今日 2 條
今天10月7日週三
  1. Mistral AI75

    Mistral AI 推出 Mistral Large 4 公開預覽版,權重預計月底釋出

    Mistral AI 推出 Mistral Large 4 公開預覽版,權重預計月底釋出。模型具原生多模態能力,總參數量為 1 trillion、活躍參數量為 49 billion,並可透過 Mistral Studio API 試用。在 Artificial Analysis Cyber Index 名列全球前五,漏洞重現及修補測試得分 82%,Cybench 則解決 93% 的挑戰。

    推薦理由:文章以 Cyber Index、漏洞重現與修補測試及 Cybench 結果,呈現 Mistral Large 4 在網絡安全基準中的相對表現。

10月6日週二
10月2日週五
10月1日週四
  1. Google DeepMind77

    Google DeepMind 發佈 Gemini 4 Argon,面向複雜長流程任務

    Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。

    推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。

9月30日週三
  1. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 正式開放使用,面向智能體編碼與專業工作負載

    GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。

    推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。

9月29日週二
  1. Hugging Face Blog65

    NVIDIA Kumo Tabular 為表格預測樹立準確率與效率的新前沿

    NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。

    推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。

  2. OpenAI News68

    OpenAI 發佈 GPT-6.1 Sol,稱其智能接近 Astra,API 輸入及輸出 token 價格為 Astra 標準價五分之一

    OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。

    推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。

9月28日週一
  1. Hugging Face Blog70

    Holo4 發佈通用電腦操作智能體模型系列

    H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。

    推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。

9月23日週三
9月16日週三
9月10日週四
9月9日週三
9月3日週四
  1. Google DeepMind75

    Google DeepMind 與 Google Research 發佈 WeatherNext 3 全球天氣 AI 模型

    Google DeepMind 與 Google Research 發佈 WeatherNext 3,利用即時地球同步衞星資料逐小時生成全球天氣預報,部分地表變數解析度達 5 公里。

    推薦理由:WeatherNext 3 以即時衞星觀測支援逐小時全球預報,並為部分變數提供 5 公里解析度;文中列出降水預測相對 IMERG、MRMS 等基線的 CRPS 改善幅度。

  2. OpenAI News74

    GPT-6 Astra 安全概覽:網絡安全能力達 Preparedness Framework 的 Critical 級別

    OpenAI 的 GPT-6 Astra 安全概覽指出,該模型是其目前廣泛部署中能力最強的模型。它也是首個在 Preparedness Framework 下達到網絡安全能力 Critical 級別的模型。

    推薦理由:這段安全概覽同時交代 GPT-6 Astra 的部署定位與網絡安全能力級別,可供讀者把模型能力描述放回 Preparedness Framework 的評估框架理解。

9月1日週二
  1. Google Research51

    Google Research 發佈 TimesFM-3 零樣本多變量時間序列預測基礎模型

    Google Research 發佈 TimesFM-3,一款原生支援多變量零樣本預測的時間序列基礎模型,可在單次前向傳播中預測多條相關序列。它有 330 million parameters,使用超過 1 trillion time points 的真實及合成時間序列資料預訓練,並能結合多個目標、歷史協變量和已知未來協變量,無需任務專用微調。

8月27日週四
  1. Google DeepMind69

    Google DeepMind 發佈 Gemini 3.5 Transcribe 語音轉文字模型

    Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。

    推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。

8月14日週五
8月12日週三
8月11日週二
8月10日週一
  1. Hugging Face Blog77

    Meta 發佈 Muse Glimmer 30B 多模態模型,採用 Apache 2.0 授權並面向本地智能體應用

    Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。

    推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。

8月6日週四
  1. OpenAI News73

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,並擴大免費用户使用 GPT-5.6 Luna 的範圍

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。

    推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。

8月4日週二
  1. Mistral AI62

    Mistral AI 發佈 3B 多模態安全分類器 Shieldstral

    Mistral AI 發佈 Shieldstral,一款 3B 開放權重多模態安全分類器,可用自然語言政策評估文字與圖像,無須重新訓練。它將內容審核設計為可在推理時指定政策的二元問答,並輸出校準後的安全分數;Mistral 稱其在多項基準上匹配或超越模型規模最高達其 7x 的開放權重安全模型。

    推薦理由:將審核政策置於推理時的自然語言問題中,使同一個 3B 模型可按部署情境調整文字與圖像判斷,無須重新訓練。

7月30日週四
  1. Google DeepMind66

    Google DeepMind 發佈 Gemini Robotics ER 2,支援影片理解、任務編排與多機械人協作

    Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。

    推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。

7月29日週三
7月28日週二
  1. Google DeepMind69

    Gemini Robotics 2 為機械人帶來全身智能控制

    Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。

    推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。

7月27日週一
7月21日週二
7月17日週五
  1. Google DeepMind65

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber 網絡安全模型

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。

    推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。

7月9日週四
7月8日週三
7月2日週四
7月1日週三