OpenAI 推出 Codex Labs,拓展 Codex 企業部署
OpenAI 推出 Codex Labs,並與 Accenture、PwC、Infosys 等合作,協助企業在整個軟件開發生命週期部署和擴展 Codex。Codex 的 WAU 達到 4M。
推薦理由:Codex Labs 將企業部署覆蓋至整個軟件開發生命週期,合作夥伴與 4M WAU 分別呈現落地方式和使用規模。
OpenAI 推出 Codex Labs,並與 Accenture、PwC、Infosys 等合作,協助企業在整個軟件開發生命週期部署和擴展 Codex。Codex 的 WAU 達到 4M。
推薦理由:Codex Labs 將企業部署覆蓋至整個軟件開發生命週期,合作夥伴與 4M WAU 分別呈現落地方式和使用規模。
OpenAI 更新 macOS 和 Windows 版 Codex app,加入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件。這些功能旨在加快開發者工作流程。
推薦理由:這組更新同時納入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件,呈現 Codex app 面向開發者工作流程的擴展範圍。
Codex app 新更新涵蓋開發者跨工具、應用程式、自動化及更多開發工作流程的使用情境。
OpenAI 為 ChatGPT Business 和 Enterprise 的 Codex 提供按用量付費定價。該選項讓團隊能以更靈活的方式開始使用並擴大採用。
OpenAI 將收購 Astral,藉此加快 Codex 發展,為下一代 Python 開發者工具提供動力。
推薦理由:這則簡短公告將收購目的連到 Codex 發展與下一代 Python 開發者工具,可據此理解交易所述的產品方向。
OpenAI 發佈 GPT-5.4 mini 和 nano,兩者是 GPT-5.4 的較小、更快速版本。它們針對編碼、工具使用、多模態推理,以及高用量 API 和子智能體工作負載作最佳化。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。
Codex Security 不依賴傳統 SAST,因此不包含 SAST 報告,而改用 AI 驅動的約束推理與驗證尋找真實漏洞。這種做法可減少誤報。
OpenAI 的 Codex Security 現已進入研究預覽,是一款 AI 應用程式安全智能體。它會分析專案脈絡,以更高信心、較少雜訊偵測、驗證並修補複雜漏洞。
Sarvam AI 開源 Sarvam 30B 和 Sarvam 105B 兩款從零訓練的推理模型,並提供 API、權重下載及本地推理範例。兩者採用 MoE Transformer 架構,分別以 16T 和 12T tokens 預訓練,並在印度使用 IndiaAI Mission 提供的算力訓練。
OpenAI 發佈 GPT-5.4,並稱其為面向專業工作的能力最強、效率最高的前沿模型。該模型具備最先進的編碼、電腦操作和工具搜索能力,並有 1M-token 上下文窗口。
OpenAI 與太平洋西北國家實驗室合作推出 DraftNEPABench,評估 AI 編碼智能體加快聯邦許可審批的能力。該 benchmark 顯示,AI 有望將 NEPA 草案撰寫時間最多縮短 15%,並展示現代化基礎設施審查的潛力。
OpenAI 與 Figma 推出新的 Codex 整合,連接程式碼與設計,讓團隊能在實作環節與 Figma 畫布之間切換。這項整合讓團隊可以更快迭代並交付。
OpenAI 的 Codex 提示詞指南介紹如何透過 API 使用 gpt-5.3-codex,並配置編碼智能體的提示詞與工具。指南建議一般互動式編碼採用 medium reasoning effort,較難任務可選 high 或 xhigh,並移除要求模型預先提供計劃、前言或執行期間狀態更新的提示。
OpenAI 不再評測 SWE-bench Verified,因其日益受到污染,且無法準確衡量前沿編碼進展。分析指出,該基準的測試存在缺陷,並有訓練洩漏;OpenAI 建議採用 SWE-bench Pro。
Gradio 6 的 gr.HTML 現支援自訂 HTML 模板、作用域 CSS 與 JavaScript 互動,讓 LLM 可把前端、後端和狀態管理整合到單一 Python 檔案,構建互動式 Web 應用。
Hugging Face 製作 CUDA kernel 技能,Claude 和 Codex 依此為 diffusers 與 transformers 目標產生可運行的 kernel。
推薦理由:文章拆解如何把 GPU 架構知識、PyTorch 整合範式與基準測試流程封裝成技能,讓編碼智能體產出可構建、可測試的 CUDA kernel 專案。
Manus 以同一組 PR 案例評測 9 款 AI 代碼審查工具,涵蓋錯誤修復、重構、依賴更新和權限邊界。結果顯示,各工具在安全關鍵邏輯的風險檢測深度上差異明顯,工作流原生整合不代表分析更深入。Manus 在明確框定為安全審查的授權反轉測試中,生成了著重失敗模式、影響和補救步驟的報告,但未原生嵌入 PR 討論串作為自動審查員。
OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。
推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。
OpenAI 技術人員 Ryan Lopopolo 探討 Harness 工程,聚焦在智能體優先的世界中如何運用 Codex。
GPT-5.3-Codex 系統卡將該模型描述為迄今能力最強的智能體編碼模型。它結合 GPT-5.2-Codex 的前沿編碼表現,以及 GPT-5.2 的推理和專業知識能力。
OpenAI 推出 macOS 版 Codex app,定位為 AI 編程與軟件開發的指揮中心,支援多個智能體、平行工作流程及長時間任務。
推薦理由:公告呈現 Codex app 在 macOS 上的工作流定位,重點是以多個智能體、平行流程和長時間任務支援 AI 編程與軟件開發。
Codex app 的入門導覽聚焦其核心工作流程,概述這款應用程式的工作方式;正文沒有提供版本或可用性資訊。
Hugging Face 介紹 upskill 如何以 Claude Opus 4.5 完成 CUDA kernel 任務、從任務軌跡生成 Agent 技能,再評估技能對其他模型的效果。文中一個示例中,unsloth/GLM-4.7-Flash-GGUF:Q4_0 的測試表現由 40% 升至 85%;部分模型使用技能後 token 用量反而增加,文章建議逐一比較。
Mistral AI 發佈 Mistral Vibe 2.0,這款由 Devstral 2 模型系列驅動的終端原生編碼智能體新增自訂子智能體、多選澄清、斜線命令技能及可配置工作模式。
推薦理由:Mistral Vibe 2.0 把自訂子智能體、執行前多選澄清和斜線命令技能納入終端編碼流程,具體呈現其工作流控制方式的變化。
操作示範説明如何在 JetBrains IDE 中使用 Codex。
一名非技術背景的內容寫作者以同一提示測試 Lovable、Replit、Bolt、Cursor 及 Manus,要求五款氛圍編碼工具製作個人作品集網站。測試中,Lovable 對初學者最友善,Manus 付費版最貼近其流行藝術設計要求;Manus 免費版出現 404 錯誤,而作者未能用 Cursor 產出網站。文章指出,工具各有適用人羣,提示須清晰具體,付費方案也可能帶來更符合創意要求的結果。
Factory 推出 Agent Readiness,按八個技術支柱和五個成熟度級別評估程式碼庫對自主開發的支援程度,並提供優先修復建議。它以 LLM 評估 60+ 項準則,並以前一份報告作為評估基準;在涵蓋低、中、高成熟度級別的 9 個基準倉庫中,評分波動由平均 7%、峯值 14.5% 降至 0.6%,連續六週維持該水平。
Hamel Husain 因 AI 編碼工具改變開發工具的取捨,停止使用自己曾協助建立及維護的 nbdev。nbdev 以 Jupyter notebooks 作為程式碼、文件和測試的單一來源,再轉譯成 Python 程式庫和文件網站;他認為這種工作流令 AI 工具難以分辨應修改 notebook 還是最終程式碼。
Datadog 使用 Codex 進行系統層級程式碼審查。正文只呈現 OpenAI 與 Datadog 的品牌圖像,沒有補充審查流程或成效。
Lovable、Replit 與 Manus 分別以提示詞生成程式碼、AI 輔助 IDE 和自主 AI Agent 建站,文中評定 Manus 為 2026 年最全面的 AI 網站建構工具。
OpenAI 表示,GPT-5.2-Codex 是其最先進的編碼模型,具備長程推理、大規模程式碼轉換及增強的網絡安全能力。
Manus 推出 Manus 1.6,帶來旗艦 Agent Manus 1.6 Max、移動應用程式開發,以及用於圖像創建和編輯的 Design View。官方稱 Max 在雙盲測試中的用户滿意度提高 19.2% 以上,並提升複雜多步驟任務的成功率;廣泛研究的所有子 Agent 現在均基於 Max 架構運行。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
Mistral AI 發佈 Devstral 2(123B)、Devstral Small 2(24B)兩款編碼模型,以及開源命令列助手 Mistral Vibe CLI。
推薦理由:Devstral 2 不只公佈基準測試成績,亦提供與 DeepSeek V3.2、Claude Sonnet 4.5 的人工評測結果,讀者可對照其在不同模型比較中的表現差異。
JetBrains 正將 GPT-5 整合至旗下編碼工具,協助數以百萬計的開發者更快設計、推理及構建軟件。
Claude Platform 於 2025 年 11 月 24 日推出 Claude Opus 4.5,面向複雜專業任務、專業軟件工程及進階智能體。更新指出,該模型在視覺、編碼和電腦操作方面有顯著改進,定價亦較此前 Opus 模型更易負擔。
推薦理由:這批更新為多工具工作流程提供兩種改善方式,程式化工具調用旨在降低延遲和 token 用量,工具搜尋則讓大型工具目錄中的工具可按需載入。
OpenAI Cookbook 示範在同一個 Realtime WebSocket 會話中,透過第二次 `response.create` 請求調用 Realtime 模型,在不寫回主對話狀態的情況下轉錄用户音訊。
OpenAI 發佈 GPT-5.1-Codex-Max,這是一款面向 Codex 的更快速、更智能的智能體編碼模型。它為長時間、專案級工作而設計,並提升推理能力與 token 效率。