預覽 GPT-5.6 Sol:新一代模型
OpenAI 預覽新一代模型 GPT-5.6 Sol,其程式編寫、科學及網絡安全能力更強,並配備 OpenAI 最先進的安全技術堆疊。
OpenAI 預覽新一代模型 GPT-5.6 Sol,其程式編寫、科學及網絡安全能力更強,並配備 OpenAI 最先進的安全技術堆疊。
Jason Liu 使用 Codex 保留脈絡並管理複雜專案。這讓工作得以延續至單一提示詞以外,支援長時間任務。
Samsung Electronics 向全球員工部署 ChatGPT Enterprise 和 Codex。OpenAI 稱,這是其規模最大的企業 AI 部署之一。
推薦理由:這則公告提供企業級 AI 落地的具體案例,交代 Samsung Electronics 面向全球員工部署的產品,也呈現 OpenAI 對此次部署規模的定位。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
文章認為,AI 尚未取代軟件工程師,單靠能力提升也不會消除這類工作的需求。作者以「決策、執行、交付」三層框架解釋,AI 壓縮程式碼實作的執行層,但需求界定、驗證及交付責任仍需人員承擔。一項涵蓋 GitHub 上 100,000 名開發者的研究顯示,AI 智能體令程式碼行數增加 8 倍,發布量只增加 30%。
Factory 為 Droid 推出自動化安全審查,在每個非草稿 PR 中與標準程式碼審查同步執行 STRIDE 審查。結果會以 diff 行內評論列出嚴重程度、CWE 參照、説明及建議修正;Droid 會對照 diff 驗證候選發現,以過濾誤報。功能現已適用於所有方案;Droid CLI / Desktop App 可設定審查,亦可在本機工作階段按需審查整個程式碼庫或目前 diff。
天體物理學家 Chi-kwan Chan 使用 Codex 建構黑洞模擬,協助科學家研究極端物理,並檢驗 Einstein 的廣義相對論。
OpenAI 計劃收購 Ona,以安全、持久的雲端環境擴展 Codex。此舉將支援 AI 智能體在企業工作流程中長時間運行。
推薦理由:這宗收購把雲端環境與 Codex 的擴展連結起來,可從中瞭解 OpenAI 如何將長時間運行的 AI 智能體延伸至企業工作流程。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
Nextdoor 工程師使用 Codex 搭配 GPT-5.5,調查難以重現的問題並跨平台開發。其工作亦聚焦產品成果。
JetBrains 發佈 Mellum2,一款以自然語言和程式碼從零訓練的 12B MoE 模型,每個 token 啟用 2.5B 參數。模型採 Apache 2.0 授權,適用於路由、RAG、摘要、子智能體及高吞吐程式功能等工作負載。
Braintrust 工程師使用 Codex 與 GPT-5.5,將客户需求轉化為程式碼。這項做法亦用於運行實驗,並加快編碼速度。
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。
Endava 使用 Codex 建構智能體組織,以加快軟件交付,並將需求分析時間由數週縮短至數小時。
Cisco 與 OpenAI 藉助 Codex 重塑企業工程,協助 Cisco 擴展 AI 原生開發、加快 AI Defense 工作,並自動化缺陷修復。
OpenAI、Thrive 與 Crete 使用 Codex 構建自我改進的税務智能體,實現申報自動化、提升準確度並加快工作流程。
Mistral 推出 Mistral Medium 3.5 公開預覽,並以此支援 Mistral Vibe 雲端遠端編碼代理及 Le Chat 的 Work mode。
推薦理由:材料展示模型、雲端編碼代理與 Le Chat 多步驟工具流程的連接方式,能看出長程任務如何落入具體產品工作流。
Virgin Atlantic 使用 Codex,在固定的假日旅遊期限前交付改版流動應用程式。成果包括近乎全面的單元測試覆蓋率,以及零宗 P1 缺陷。
OpenAI 獲 Gartner 評為 2026 年企業級 AI 編碼智能體魔力象限的領導者。Codex 因創新及企業規模部署獲得認可。
Ramp 工程師使用 Codex 搭配 GPT-5.5 審查程式碼並交付改進,讓取得實質回饋的時間由數小時縮短至數分鐘。
Google Research 開放 ERA 科學研究工具,並開始逐步開放由 ERA 與 AlphaEvolve 構建的 Computational Discovery。
推薦理由:文章把 ERA 的樹狀搜尋方法與多學科基準和實際科學問題並置,呈現其從程式碼優化延伸至預測研究的應用範圍。
OpenAI 與 Dell 合作,將 Codex 帶進混合式及本地部署企業環境。合作協助企業跨數據與工作流程安全部署 AI 編碼智能體。
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
Sea Limited 正在各工程團隊部署 Codex,以加快亞洲的 AI 原生軟件開發。其首席產品官闡述此舉背後的原因,並談及 Codex 與智能體軟件開發的未來。
OpenAI 讓用户透過 ChatGPT 手機應用程式跨裝置及遠端環境使用 Codex。用户可即時監看、調整及核准編碼任務。
推薦理由:這項更新把 Codex 編碼任務的監看、調整與核准延伸至 ChatGPT 手機應用程式,讓相關操作可跨裝置及遠端環境進行。
OpenAI 為 Codex 在 Windows 上構建安全有效的沙盒,支援 Codex 在 Windows 上運行。沙盒設有受控檔案存取及網絡限制。
Parameter Golf 匯集 1,000+ 名參與者及 2,000+ 份投稿,探索在嚴格限制下進行 AI 輔助機器學習研究。探索範圍包括編碼智能體、量化及新型模型設計。
AutoScout24 Group 透過 AI 驅動工作流程使用 Codex 和 ChatGPT,加快開發週期、提升程式碼品質,並擴大 AI 採用。
Manus Website Builder 的 Make a Copy 功能可將現有 WebDev 項目複製到新的獨立工作階段,讓用户在不影響原項目的情況下修改和測試。副本會保留最新檢查點或提交的完整程式碼庫、資料庫結構及密鑰和值,並只帶入簡短對話摘要。資料庫資料行、自訂網域設定和 GitHub 連線不會轉移,副本初始狀態為未發佈。
OpenAI 透過沙箱、審批、網絡政策及智能體原生遙測,安全運行 Codex。這些措施支援安全且合規地採用編碼智能體。
Simplex 藉助 ChatGPT Enterprise 和 Codex 推動軟件開發,縮短設計、建構及測試所需時間,並擴展 AI 驅動的工作流程。
OpenAI 的 B2B Signals 研究展示前沿企業如何深化 AI 採用、擴大 Codex 驅動的智能體工作流程,並建立持久競爭優勢。
Jack Clark 根據公開研究與產品進展,估計到 2028 年底前,AI 系統自主訓練後繼模型、實現無人參與 AI 研發的機率約為 60%。他以 SWE-Bench 成績由 Claude 2 的約 2% 升至 Claude Mythos Preview 的 93.9%,以及 AI 在研究復現、模型微調和長時間任務上的進展,作為主要依據。
OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。
推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。
Manus Blog 以同一份個人理財網站提示詞實測 Replit、Manus AI、Lovable、Vercel v0、Base44 和 Hostinger Horizons,並比較各工具的生成結果與使用體驗。
Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。
推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。
OpenAI 的 GPT models、Codex 與 Managed Agents 現已在 AWS 提供。OpenAI 表示,企業可在 AWS 環境建構安全 AI。
推薦理由:這項 AWS 上線交代了 OpenAI GPT models、Codex 與 Managed Agents 的可用範圍,也説明企業可在 AWS 環境建構安全 AI 的使用場景。
OpenAI 介紹 GPT-5.5,這是一款面向跨工具複雜任務的模型,涵蓋編碼、研究與數據分析。
Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。
推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。
Factory 的 Automated QA 技能由 Droid 在每次推送時按真實用戶方式測試應用程式,並在 PR 留下附有測試證據的結構化報告。團隊可將 CI 設為可選檢查,或在 Droid 工作階段執行 `/qa` 本機測試;`/install-qa` 會按專案設定生成 QA 技能。Automated QA 現已提供予所有 Factory 方案。