Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 開放預覽
Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 已透過 Gemini API、Google AI Studio 和 Vertex AI 提供預覽。
推薦理由:文章並列 Gemini 3 Pro 的基準成績、API 定價和接入渠道,亦介紹 Google Antigravity 如何跨工作區管理智能體,具體呈現模型與開發流程的結合方式。
Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 已透過 Gemini API、Google AI Studio 和 Vertex AI 提供預覽。
推薦理由:文章並列 Gemini 3 Pro 的基準成績、API 定價和接入渠道,亦介紹 Google Antigravity 如何跨工作區管理智能體,具體呈現模型與開發流程的結合方式。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。
Google 推出 Antigravity 智能體開發平台,並免費開放公開預覽。平台保留 AI IDE 編輯器,另設以智能體為核心的 Manager,支援瀏覽器控制及非同步互動,讓智能體自主規劃和執行端到端軟件任務;Artifacts 可供使用者檢視工作成果並提供回饋。
推薦理由:Antigravity 將 IDE 編輯與 Agent Manager 分成不同工作介面,並以任務級 Artifacts、驗證結果和非同步回饋呈現及修正智能體工作。
OpenAI 已在 API 中提供 GPT-5.1,帶來更快的自適應推理、擴展的提示詞快取及更佳的編碼表現。API 新增 apply_patch 和 shell 工具。
推薦理由:更新涵蓋自適應推理、提示詞快取、編碼表現及 apply_patch 和 shell 工具,勾勒 GPT-5.1 面向開發者的 API 改進範圍。
Inception Labs 發佈升級版 Mercury 擴散式大語言模型,稱其編碼、指令遵循、數學問題求解與知識回憶表現均有提升。
Codex 與開發者協作梳理程式碼差異,並提供行內建議。開發者可據此更有信心地合併變更。
OpenAI Codex Cloud 示範將草圖和照片轉化為響應式介面,展示使用 OpenAI Codex 構建前端的方式。
Sora、ImageGen 與 Codex 的多模態流程連結影片、圖像及程式碼生成工具,聚焦創意工作流。
OpenAI Codex CLI 使用指南涵蓋搭配 GPT-5-Codex 的操作方式,並説明安裝、身份驗證和進階使用工作流程。
多個團隊分享了使用 Codex 端到端交付真實軟件的經驗,內容聚焦產品交付。
上下文策略聚焦於如何讓 Codex 式編碼智能體在 Cursor 中協作。討論亦涉及智能體與上下文窗口。
Manus 推出 Manus 1.5,提供具備最新架構完整功能的 Manus-1.5,以及以成本效益為優化方向的精簡版 Manus-1.5-Lite,涵蓋研究、數據分析、網頁開發和簡報製作等任務。
HYGH 藉助 ChatGPT Business 加快軟件開發與營銷活動交付,縮短周轉時間並擴大產出。此舉亦帶動收入增長。
BigCodeArena 推出以程式碼實際執行評估程式生成模型的平台,讓使用者並排比較模型、測試輸出並投票。平台支援 10 種語言和 8 種執行環境,並已收集逾 14,000 段對話及 4,731 個投票樣本。
推薦理由:平台把程式實際執行和互動測試納入模型比較,並按程式語言與執行環境拆分結果,呈現總體排名之外的表現差異。
OpenAI Codex 現已正式全面開放,新增 Slack 整合、Codex SDK 及管理工具。管理工具包括用量儀錶板和工作區管理,讓開發者更易於使用並大規模管理 Codex。
推薦理由:Slack 整合、Codex SDK、用量儀錶板與工作區管理,勾勒出 Codex 從開發者使用到規模化管理的功能範圍。
DeepSeek 將 API 中的 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1-Terminus,分別對應非思考模式與思考模式。更新維持模型原有能力,減少中英文混雜及偶發異常字元。Code Agent 和 Search Agent 的效能亦獲進一步優化。
OpenAI 為 Codex 推出升級,提升速度、可靠性、即時協作能力,以及在不同開發環境中獨立處理任務的能力。使用者可透過終端、IDE、網頁或手機使用 Codex。
OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。
推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1,兩者分別對應非思考模式和思考模式。
OpenAI 在 API 平台推出 GPT-5,提供高推理性能和麪向開發者的新控制項,並稱其在真實編碼任務上達到同級最佳表現。
GPT-5 為編碼與設計開啟新的可能性,內容聚焦它如何在這兩個領域帶來新的探索方向。
Cursor 使用 GPT-5;相關內容聚焦於其使用方式,但未提供具體操作細節。
OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。
推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。
Mistral AI 發佈 Codestral 25.08,並推出整合程式碼補全、語意檢索、Devstral 智能體工作流及 Mistral Code IDE 外掛的企業編碼技術棧。
推薦理由:文章把 Codestral 25.08、程式碼檢索、Devstral 智能體工作流與 IDE 管理整合為企業方案,並交代部署選項及安全治理設計。
OpenAI Codex 編程概覽以使用 Codex 進行編程為主題,提供相關內容的整體介紹。原文未列出具體功能、操作步驟或技術細節。
OpenAI 的 Structured Outputs 示例倉庫收錄三個以 NextJS 構建的 sample apps,展示此 API 功能的實際用法。Structured Outputs 可令模型回應和工具調用遵循指定 JSON schema。
OpenAI 的 Predicted Outputs 指南説明,Chat Completions 可透過 `prediction` 參數提供預測文本,在輸出內容大致已知時加快 API 回應。
Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。
推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。
Mistral AI 推出 Mistral Code,將編碼模型、IDE 助手、部署選項及企業管理工具整合為面向企業的 AI 編碼助手。產品現已為 JetBrains IDEs 和 VSCode 開放私測,正式版計劃稍後推出,部署方式包括 serverless、雲端及自託管。
Mistral AI 發佈首款程式碼專用嵌入模型 Codestral Embed,面向真實程式碼檢索。官方稱其檢索表現優於 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型;採用 256 維、int8 精度時仍優於競品。
CodeRabbit 使用 OpenAI 的 o3、o4-mini 和 GPT-4.1 進行程式碼審查,提升審查準確度並加快 PR 合併。這亦協助開發者更快交付程式碼、減少錯誤並提高 ROI。
Mistral AI 發佈與 All Hands AI 合作打造的 Devstral,這款面向軟件工程任務的智能體大語言模型以 Apache 2.0 授權免費開源。
推薦理由:Devstral 在 SWE-Bench Verified 得分 46.8%,較此前開源 SoTA 高逾 6 個百分點,讓模型處理真實 GitHub issue 的基準表現有量化參照。
OpenAI Developers 示範使用 Evals API 的 `responses` 數據源,從日誌比較 gpt-4o-mini 與 gpt-4.1-mini 對 OpenAI SDK 程式碼檔案的解釋品質。
Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。
推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。
OpenAI 將 GPT-4.1 新模型系列引入 API,並同步推出首款 nano 模型。OpenAI 表示,該系列整體有所改進,尤其在編碼、指令遵循和長上下文理解方面提升顯著,並即日起向全球開發者開放。
推薦理由:公告列出 API 開放時間、改進方向及 nano 型號,讓開發者掌握此次 GPT-4.1 更新的發布範圍。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V3-0324,並公佈多項基準分數提升及功能改進。MMLU-Pro 由 75.9 升至 81.2(+5.3),GPQA 由 59.1 升至 68.4(+9.3),AIME 由 39.6 升至 59.4(+19.8),LiveCodeBench 由 39.2 升至 49.2(+10.0)。
Open R1 的指南示範如何在本機設定 OlympicCoder 7B,並將它接入 VS Code 作為編碼助手。流程使用 LM Studio 載入 LMStudio Community 的 4bit GGUF 版本,再透過 Continue.dev 連接至本機服務 http://localhost:1234/v1。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
透過 OpenAI,工程週期加快 20%。
OpenAI 推出 SWE-Lancer 基準測試,探問前沿 LLM 能否透過真實世界的自由接案軟件工程工作賺取 $1 million。