GPT-6 Astra 數學基準測試領先,但軟件工程未居首
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。
OpenAI 圍繞 Codex 運作智能體軟件工廠,讓智能體參與編碼、測試、審查、部署及生產監控。Perf Factory 會整理告警與儀錶板、識別延遲回退並提出修復建議,部署智能體亦會監測變更相關訊號。Codex 帶來的程式碼增量令部分建置、測試及部署系統在約 6 個月內負荷增至約 10 倍,團隊因此重新思考 PR 和程式碼審查流程。
Factory 宣佈完成 $200M 融資,估值達 $5B,並將資金用於加快研究、產品及全球市場拓展。
Cognition 藉助 GPT‑6 Astra 提升 Devin 測試軟件並驗證其可正常運作的能力。目標是讓工程師減少審閲程式碼,並交付更多成果。
Cursor 推出 Projects,現正以 beta 階段逐步向所有用户開放,讓協調智能體承接跨月工作並委派子智能體。Projects 預設在雲端運行,需要時可切換至本地,並透過共享上下文及監聽 Slack 頻道、按計劃運行或跟進 PR 來主動處理工作。Cursor 表示,新用户合併 PR 數量提升 30%,而主要使用 Projects 的用户合併量達原來六倍。
推薦理由:Projects 將長週期工作的上下文累積、智能體委派和事件觸發整合起來,文中亦提供新用户與主要使用者的 PR 合併量數據。
Pragmatic Engineer 訪問 Codex 開發者、OpenAI Core Products & Platform 部門主管 Tibo Sottiaux,探討 Codex 的構建決策、演進及團隊使用方式。
面對 AI 智能體生成更多程式碼和 PR 所帶來的審查量增長,各團隊採用不同流程,沒有適用所有團隊的單一方案。GitHub 數據顯示,三年間開啟的 PR 數量增至五倍,2025 年底增長加速,PR 和 commits 數量在當時幾乎翻倍。常見做法包括由人審核 AI 的程式碼審查結果、按變更風險決定是否人工審查,以及改為審查計劃、測試或資料庫 schema。
1Password 的工程師使用 Codex 快速開發新功能和內部工具,工程生產力提升 21%。這些成果在維持嚴格安全政策的同時,已達到可投入生產環境的準備狀態。
OpenAI 內部的編碼智能體正重塑 AI 研究。早期數據涵蓋智能體使用情況、實驗速度、任務複雜度及研究加速。
GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。
推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。
OpenAI 推出 GPT-6 Astra,稱其為迄今最智能、最符合對齊要求的模型。OpenAI 表示,模型在電腦操作、編碼、網絡安全及科學領域具備最先進能力。
OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
Cursor 推出自託管機器功能,讓雲端智能體的工具執行可轉移至團隊自有網絡內的機器,而智能體的推理與規劃仍由 Cursor 雲端負責。團隊可用單機或資源池接入自有基礎設施,資源池會按排隊請求自動擴縮,並可透過快照讓閒置機器休眠及恢復。
Nokia 核心網部門表示,兩名工程師藉助 Cursor 在兩週內分析某條產品線超過 5000 萬行程式碼,無需自訂工具。分析為拆解單體架構、轉向分散式服務架構提供規劃依據,並據 Nokia 估算,數月內釋放十多名專家投入其他項目。Cursor 亦協助 Nokia 將新功能部署工作流約 80% 自動化及可視化,並把根因分析由數週縮短至數天。
loveholidays 使用 OpenAI Codex,讓公司各團隊更容易參與軟件開發。這有助團隊更快把想法轉化為產品。
IBM 發佈 Granite 4.2 語言模型,提供 3B、8B 和 30B 參數版本,並加入原生逐步推理與工具調用能力,面向企業智能體工作流程。模型基於 Granite 4.0 foundation models,採多階段強化學習;8B 和 30B 版本另經 agentic RL,並以 1 trillion tokens 的合成程式碼訓練,採 Apache 2.0 授權。
Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。
推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。
GPT-5.6 現已在 Kiro 中提供,協助開發者以更佳性價比規劃、建構、審查及測試軟件。
Gergely Orosz 訪問 Addy Osmani,回顧他從 Chrome DevTools、Core Web Vitals 到 AI 開發者體驗的工作歷程。
Replit 透過由 GPT-5.6 Luna 驅動的 Free Mode 擴大軟件創作入口。Free Mode 讓任何人把想法轉化為可運作的軟件,並稱毋須擔心 token 費用。
作者訪談近 20 位正休職或認真考慮休假的工程領導者,整理高階主管離職或暫停職涯的常見原因。原因包括工作條件惡化、初創企業前景和股權轉差、難以累積 AI 經驗,以及團隊縮小令管理職需求下降。作者私下詢問的工程領導者中,6/10 表示正準備離開職位。
Asana 使用 OpenAI Codex,在 2 週內替換一套過時的測試系統,並完成原需數年的程式碼遷移。此次使用的模型與基礎設施成本約為 $12K。
SpaceX 已正式完成對 Cursor 的收購,結束始於 4 月的收購流程。雙方當時宣佈合作以加速模型訓練;Cursor 表示,與 SpaceX 攜手後可使用全球最大的 GPU 集羣,打造更強且運行成本更低的模型。Cursor 稱,星期三發布的 Grok 4.6 初步展示雙方共同打造的成果,並表示 Cursor 將成為讓這類智能發揮實用價值的場域之一。
推薦理由:這則消息把 Cursor 的收購與模型建設所需算力、降低成本的計劃放在同一脈絡中,Grok 4.6 被列作初步成果。
Firetiger 團隊將加入 Cursor,其智能體可監控軟件發布、發現回歸、調查事件,並把發現反饋給編程智能體。Cursor 表示,雙方會讓這些系統更緊密協同,使智能體能交付變更、觀察其表現,並在問題出現時響應。相關工作還包括為智能體時代打造的 Git forge Cursor Origin,以及即將推出、會監控已部署變更並在問題出現時標記的 Change Monitors。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 產品開發,並集中工程與營運部門的營運情報。相關應用涵蓋工程至營運。
Cursor 與 SpaceXAI 共同發佈 Grok 4.6,該模型基於 Grok 4.5,重點面向長時間運行的智能體及更複雜的互動和視覺工作。它在多項智能體編程和知識工作基準測試中展現前沿智能水平,並在由九項基準測試構成的 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 持平。
Sarvam AI 在 Sarvam Epoch 公佈 Sarvam 105B 的對話及工作智能體版本,並介紹 Sarvam Vision 2.0、Saaras V4 和研究預覽版 Bulbul V4。
Cursor 分享了為雲端智能體搭建開發環境的方法,讓雲端 VM 貼近本地開發,並支援智能體測試程式碼及維護環境。團隊以 Dockerfile 配置依賴,以 anydev 簡化服務啟動,並透過 Cursor Cloud MCP 和 Cloud Doctor 診斷、修復環境及改善工作流。去年 12 月,合併到 Cursor 單體倉庫的 PR 中約十分之一由雲端智能體編寫,如今已超過一半。
科學家正運用 AI 編碼智能體推動科學計算現代化,加快基因組學及其他領域的軟件開發與發現。
Thariq Shihipar 分享 Claude 5 世代模型的上下文工程新規則,主張減少限制並按需載入指引。Anthropic 團隊為 Claude Opus 5 和 Claude Fable 5 將 Claude Code 的系統提示詞削減逾 80%,編碼評測未見可測量的表現下降。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
OpenAI 的創意團隊運用 Codex 和上下文感知 AI 建構自訂創意工具、加快構思,並更快製作原型。
Arvind Narayanan 在 ICML 主題演講中主張,AI 會逐步改變並重組工作,但不會因實驗室內某個能力里程碑而突然令所有人失業。他以 AI as Normal Technology 框架概括能力、產品、早期採用和適應四個階段,認為工作結構的適應最慢,需時數十年。他預期 AI 會令工作重心由建造系統轉向評估、判斷與引導,並主張培養與 AI 互補的技能及維持使用上的自主掌控。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex,加快應對支付業務的複雜性。AP+ 節省時間、改善品質,並以人類判斷為核心。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。