Prime Intellect 啟動 INTELLECT-2 全球分散式 32B 參數模型強化學習訓練
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
Reflection AI 發佈首款開放權重大模型 Beam,採用稀疏激活架構,總參數量為 5010 億,每次任務啟用 230 億參數。Reflection AI 稱,Beam 的性能可對標智譜 AI(Z.ai)的 GLM‑5.2,在編碼及智能體任務方面逐步逼近千問的 Qwen3.8‑Max。
Reflection 正式發佈首個前沿開放權重模型 Beam,稱其在進階推理基準上媲美 Z.ai 的 GLM-5.2,並勝過領先西方開放模型。Reflection 稱 Beam 推理算力用量少 3-4x,但相關效能主張尚未經獨立核實。
DeepSeek-V4.1-Flash 正式發佈,是 DeepSeek 新架構系列中最小的模型,並支援原生多模態視覺理解。
DeepSeek 已在 DeepSeek API 平台提供實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp,可透過 `model='deepseek-v4-flash-vision-exp'` 調用。
DeepSeek-V4-Pro GA 版本已在 APP、Web 和 API 上線,API 呼叫方式不變,將模型名稱設為 `deepseek-v4-pro` 即可使用最新版。
DeepSeek 將 DeepSeek-V4-Flash API 開放公開 Beta,並稱其智能體能力顯著增強,基準測試結果遠高於 V4-Pro-Preview。
深度求索(DeepSeek)發佈 DeepSeek-V4,Pro、Flash 系列各有 instruct 與 base 版本,四款 checkpoint 均支援 1M-token 上下文。
推薦理由:文章把 KV cache 成本、混合注意力設計與智能體工作流串連起來,並以基準數據呈現長上下文能力在工具任務中的表現。
DeepSeek 透過臨時端點提供 DeepSeek-V3.2-Speciale,收費與 V3.2 相同,且不提供工具呼叫。此服務提供至 2025 年 12 月 15 日 15:59(UTC)。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.2。deepseek-chat 對應非思考模式,deepseek-reasoner 對應思考模式。更新日誌:https://api-docs.deepseek.com/updates#deepseek-v32
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.2-Exp,分別對應其非思考模式與思考模式。詳情可參閲更新日誌:https://api-docs.deepseek.com/updates#deepseek-v32-exp。
DeepSeek 將 API 中的 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1-Terminus,分別對應非思考模式與思考模式。更新維持模型原有能力,減少中英文混雜及偶發異常字元。Code Agent 和 Search Agent 的效能亦獲進一步優化。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1,兩者分別對應非思考模式和思考模式。
DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,並公佈多項基準的 Pass@1 提升。AIME 2025 由 70.0 升至 87.5(+17.5),GPQA 由 71.5 升至 81.0(+9.5),LCB_v6 由 63.5 升至 73.3(+9.8),Aider 由 57.0 升至 71.6(+14.6)。
推薦理由:DeepSeek-R1-0528公佈多項基準提升數據,並提示複雜推理任務較舊版消耗更多 tokens,可供比較版本能力表現與用量。
DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。
推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V3-0324,並公佈多項基準分數提升及功能改進。MMLU-Pro 由 75.9 升至 81.2(+5.3),GPQA 由 59.1 升至 68.4(+9.3),AIME 由 39.6 升至 59.4(+19.8),LiveCodeBench 由 39.2 升至 49.2(+10.0)。
DeepSeek 將 deepseek-chat 模型升級為 DeepSeek-V3,API 保持不變。使用者仍可透過指定 model='deepseek-chat' 調用 DeepSeek-V3。
推薦理由:這次更新交代 DeepSeek-V3 與既有 API 調用方式的關係,使用者仍可指定 deepseek-chat 調用新模型,便於沿用現有接入方式。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2.5-1210,並改善多項能力。MATH-500 成績由 74.8% 提升至 82.8%,LiveCodebench(08.01 - 12.01)準確率由 29.2% 升至 34.38%;內部測試亦顯示寫作和推理有所改善。新版本亦優化檔案上傳和網頁摘要功能的使用體驗。
DeepSeek 將 DeepSeek V2 Chat 與 DeepSeek Coder V2 合併升級為 DeepSeek V2.5。
DeepSeek 將 deepseek-coder 模型升級至 DeepSeek-Coder-V2-0724。這項升級記錄於 DeepSeek API 更新日誌。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0628,並稱模型的推理能力有所提升。HumanEval Pass@1 由 79.88% 升至 84.76%,MATH ACC@1 由 55.02% 升至 71.02%,BBH 由 78.56% 升至 83.40%。
DeepSeek 將 deepseek-coder 升級至 DeepSeek-Coder-V2-0614,編碼能力顯著提升。其程式碼生成、理解、除錯及補全能力達到 GPT-4-Turbo-0409 水平,數學與推理能力出色,通用能力則與 DeepSeek-V2-0517 相當。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 準確率由 63.9% 升至 77.6%。