OpenAI 更新 macOS 和 Windows 版 Codex app,加入電腦操作等功能
OpenAI 更新 macOS 和 Windows 版 Codex app,加入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件。這些功能旨在加快開發者工作流程。
推薦理由:這組更新同時納入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件,呈現 Codex app 面向開發者工作流程的擴展範圍。
AI 寫代碼的一切:編碼助手、Vibe Coding、代碼模型評測與開發工作流變革。
OpenAI 更新 macOS 和 Windows 版 Codex app,加入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件。這些功能旨在加快開發者工作流程。
推薦理由:這組更新同時納入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件,呈現 Codex app 面向開發者工作流程的擴展範圍。
OpenAI 將收購 Astral,藉此加快 Codex 發展,為下一代 Python 開發者工具提供動力。
推薦理由:這則簡短公告將收購目的連到 Codex 發展與下一代 Python 開發者工具,可據此理解交易所述的產品方向。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
OpenAI 發佈 GPT-5.4,並稱其為面向專業工作的能力最強、效率最高的前沿模型。該模型具備最先進的編碼、電腦操作和工具搜索能力,並有 1M-token 上下文窗口。
Hugging Face 製作 CUDA kernel 技能,Claude 和 Codex 依此為 diffusers 與 transformers 目標產生可運行的 kernel。
推薦理由:文章拆解如何把 GPU 架構知識、PyTorch 整合範式與基準測試流程封裝成技能,讓編碼智能體產出可構建、可測試的 CUDA kernel 專案。
OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。
推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。
OpenAI 推出 macOS 版 Codex app,定位為 AI 編程與軟件開發的指揮中心,支援多個智能體、平行工作流程及長時間任務。
推薦理由:公告呈現 Codex app 在 macOS 上的工作流定位,重點是以多個智能體、平行流程和長時間任務支援 AI 編程與軟件開發。
Mistral AI 發佈 Mistral Vibe 2.0,這款由 Devstral 2 模型系列驅動的終端原生編碼智能體新增自訂子智能體、多選澄清、斜線命令技能及可配置工作模式。
推薦理由:Mistral Vibe 2.0 把自訂子智能體、執行前多選澄清和斜線命令技能納入終端編碼流程,具體呈現其工作流控制方式的變化。
OpenAI 表示,GPT-5.2-Codex 是其最先進的編碼模型,具備長程推理、大規模程式碼轉換及增強的網絡安全能力。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
Mistral AI 發佈 Devstral 2(123B)、Devstral Small 2(24B)兩款編碼模型,以及開源命令列助手 Mistral Vibe CLI。
推薦理由:Devstral 2 不只公佈基準測試成績,亦提供與 DeepSeek V3.2、Claude Sonnet 4.5 的人工評測結果,讀者可對照其在不同模型比較中的表現差異。
Claude Platform 於 2025 年 11 月 24 日推出 Claude Opus 4.5,面向複雜專業任務、專業軟件工程及進階智能體。更新指出,該模型在視覺、編碼和電腦操作方面有顯著改進,定價亦較此前 Opus 模型更易負擔。
推薦理由:這批更新為多工具工作流程提供兩種改善方式,程式化工具調用旨在降低延遲和 token 用量,工具搜尋則讓大型工具目錄中的工具可按需載入。
Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 已透過 Gemini API、Google AI Studio 和 Vertex AI 提供預覽。
推薦理由:文章並列 Gemini 3 Pro 的基準成績、API 定價和接入渠道,亦介紹 Google Antigravity 如何跨工作區管理智能體,具體呈現模型與開發流程的結合方式。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。
Google 推出 Antigravity 智能體開發平台,並免費開放公開預覽。平台保留 AI IDE 編輯器,另設以智能體為核心的 Manager,支援瀏覽器控制及非同步互動,讓智能體自主規劃和執行端到端軟件任務;Artifacts 可供使用者檢視工作成果並提供回饋。
推薦理由:Antigravity 將 IDE 編輯與 Agent Manager 分成不同工作介面,並以任務級 Artifacts、驗證結果和非同步回饋呈現及修正智能體工作。
OpenAI 已在 API 中提供 GPT-5.1,帶來更快的自適應推理、擴展的提示詞快取及更佳的編碼表現。API 新增 apply_patch 和 shell 工具。
推薦理由:更新涵蓋自適應推理、提示詞快取、編碼表現及 apply_patch 和 shell 工具,勾勒 GPT-5.1 面向開發者的 API 改進範圍。
BigCodeArena 推出以程式碼實際執行評估程式生成模型的平台,讓使用者並排比較模型、測試輸出並投票。平台支援 10 種語言和 8 種執行環境,並已收集逾 14,000 段對話及 4,731 個投票樣本。
推薦理由:平台把程式實際執行和互動測試納入模型比較,並按程式語言與執行環境拆分結果,呈現總體排名之外的表現差異。
OpenAI Codex 現已正式全面開放,新增 Slack 整合、Codex SDK 及管理工具。管理工具包括用量儀錶板和工作區管理,讓開發者更易於使用並大規模管理 Codex。
推薦理由:Slack 整合、Codex SDK、用量儀錶板與工作區管理,勾勒出 Codex 從開發者使用到規模化管理的功能範圍。
OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。
推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。
OpenAI 在 API 平台推出 GPT-5,提供高推理性能和麪向開發者的新控制項,並稱其在真實編碼任務上達到同級最佳表現。