Mistral 發佈 Mistral Large 4 公開預覽,權重將於月底釋出
Introducing Mistral Large 4
Mistral AI 推出 Mistral Large 4(ML4)公開預覽版,稱模型有 1 trillion 參數、其中 49 billion 為活躍參數,並原生支援多模態;目前可試用的是預覽 API,模型權重則預計本月底釋出。公告列出多項網絡安全、編碼、代理工作流程及其他基準成績,但結果須按各自的測試條件理解,亦有部分來自公司內部評估。
公開預覽、模型規模與部署
Mistral AI 表示,ML4 是其迄今最大、能力最強的模型,並會繼續改進。模型由零開始訓練,使用 Mistral 在歐洲自營數據中心的 3,800 部 NVIDIA Grace Blackwell GPU;公開預覽亦由同一基礎設施提供。Mistral 稱訓練資料有相當部分為多語言,涵蓋逾 160 種語言,包括歐盟所有官方語言。
- 現時可透過 Mistral Studio 試用預覽 API;模型權重預計本月底釋出。
- Mistral 計劃在全球多個地區提供模型,當中包括由公司端到端營運、依循歐洲法律的歐洲部署。
- Mistral 表示,模型釋出後可供機構在私有雲或本地部署;權重發布前,模型正與網絡安全業界領袖、經審核合作夥伴及政府機關進行真實環境紅隊測試,參與者可使用限制較少、網絡安全能力較強的版本。
網絡安全:基準成績突出,測試範圍各有不同
Mistral 引述 Artificial Analysis Cyber Index 的獨立評估,稱 ML4 排名全球前五,並大幅領先中國以外開發的開放權重模型。公告亦指出,部分封閉模型在特定漏洞重現及修補測試中因拒絕執行任務而接近零分;這是該項測試的結果,不代表模型在所有網絡安全工作上的整體比較。
- Mistral 稱 Claude Opus 5.5 和 GPT-6 Astra 等數個領先封閉模型,在同一漏洞測試中因拒絕執行而接近零分;公司以此説明安全研究和事故應對工作可能受模型拒絕機制限制。
- Mistral 的內部測試亦發現 ML4 可用於分析惡意軟件、為漏洞排優先次序及撰寫偵測規則;這些是公司報告的測試結果。
| 測試或比較 | 公告所述結果 | 條件 |
|---|---|---|
| Artificial Analysis Cyber Index | 全球前五;領先中國以外開發的開放權重模型 | 評估模型在真實軟件中尋找及修補安全漏洞的能力 |
| 漏洞重現及修補測試 | 82%,公告稱為所有模型中最高 | 要求重現開源軟件中的一個真實漏洞,再修補漏洞 |
| Cybench | 解決 93% 挑戰 | 共 40 項源自網絡安全競賽的練習 |
編碼及代理工作流程
在編碼基準方面,Mistral 引用 Artificial Analysis coding index 的數字;公司公佈 ML4 的 Coding Agent Index 綜合分數為 49.8%,高於 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。分數反映各項指定測試,不等同所有軟件工程任務的表現。
- Mistral 與 Surge AI 進行盲測編碼質素評估,由專業評審在 1–5 分尺度評分,並隱藏模型身分。ML4 Preview 得 3.74 分,在五個模型中排第二;Claude Opus 5 得 4.22 分,Kimi K3 得 3.59 分,GLM-5.3 得 3.60 分,GLM-5.2 得 3.40 分。
- AutomationBench 評估跨應用的商業工作流程;AA-Briefcase 則測試長流程知識工作,包括試算表、簡報及 PDF 等交付成果。
| 測試 | ML4 結果 | 公告提供的條件或比較 |
|---|---|---|
| DeepSWE v1.1 | 61.7% | 數字引用自 Artificial Analysis coding index |
| SWE-Atlas-QnA | 59.4% | 數字引用自 Artificial Analysis coding index |
| Terminal-Bench 4 | 28.3% | 數字引用自 Artificial Analysis coding index |
| Coding Agent Index | 49.8% | 公告稱高於 DeepSeek V4 Pro 0813 和 Qwen3.8 Max |
| AutomationBench | 59.9% | 涵蓋 657 個跨 Gmail、Google Sheets、Slack 及 Salesforce 等應用的商業工作流程;公告稱高於 Kimi K3、MiMo-V2.6-Pro 及 DeepSeek V4 Pro |
| AA-Briefcase | 1,393 Elo | 評估長流程知識工作;公告稱高於 DeepSeek V4 Pro |
多模態、科學與專業工作
Mistral 稱 ML4 在圖像理解方面有明顯進步,可處理複雜文件、圖表及自然圖像,並把視覺定位與代理能力結合,例如檢視大型衞星圖像或工程圖。公告特別提到 Dense 200 的視覺定位結果高於 GPT-6-Astra;其他科學及專業工作表現則多以公司評估或基準比較描述,未有在公告中提供分數。
- 在 Dense 200,ML4 得 42%,GPT-6-Astra 得 41%;Mistral 將 ML4 評為其測試中視覺定位能力最強的模型之一。
- 在 SciCode-Verified,Mistral 稱 ML4 是開放權重模型中的領先者。公司亦以一次生成 Hartree–Fock 模擬作為化學工作能力示例。
- 法律及金融代表性任務由第三方評估者 vals.ai 評測;Mistral 表示 ML4 在兩類任務均超越 GPT-6-Astra。公司亦稱 ML4 在 HarveyAI Legal Agent 基準中勝過所有開源模型。
- Mistral 的內部專家評估比較 ML4 與 GLM-5.3:ML4 在電腦輔助設計(CAD)及科學、科技、工程及數學(STEM)項目中較受偏好,在金融及編碼方面則表現相若或接近。
安全基準與拒絕行為
Mistral 報告稱 ML4 在間接提示注入及多項安全基準上表現靠前。這些分數是公告所列基準的結果;公告沒有把它們描述為對所有實際環境的防護保證。
| 基準或測試 | 公告所述結果 | 條件 |
|---|---|---|
| Lakera 公開 B3 AI Security Benchmark | 抵抗 93.3% 攻擊;Mistral 稱競爭模型中未見更高分數 | 公開安全基準 |
| KORA Benchmark | 1.691;Mistral 稱為其測量到的開放權重模型最高分 | 滿分為 2;2 代表 Exemplary |
| 惡意網絡安全提示的拒絕率 | 平均拒絕率高於所有開放權重模型 | Mistral 引述 JailbreakBench、StrongREJECT 及 AgentHarm 的網絡安全提示測試 |
強化學習規模與後續計劃
Mistral 表示,其強化學習(RL)系統會以模型自身嘗試的結果進行訓練,並可在同一訓練流程中組合聊天、科學問題、安全對齊、事實性及長流程工具使用等任務。公司稱目前在 3k GPUs 的規模下,單次訓練每日產生約 33 billion tokens,經過篩選及遮罩後,約 16 billion 為可訓練的 completion tokens。這是 RL 訓練規模,與 ML4 從零開始訓練所用的 3,800 部 GPU 為不同數字。
- Mistral 稱 RL 訓練仍在進行,模型尚未飽和,並預期擴大自營歐洲數據中心的運算能力後,未來數週及數月會有大幅改進;這些是公司的預期,並非已公佈的後續測試結果。
- 模型權重預計本月底釋出;Mistral 亦承諾提供更多架構、基準及後訓練方法細節,並以 ML4 為新一代專用及優化模型的基礎。
文章列出 Cyber Index、Cybench 與 Coding Agent Index 等結果,呈現 Mistral Large 4 在網絡安全、編碼等任務上的比較位置。
來源:Mistral AI · mistral.ai