GitHub 推出 ReviewBench,作為 AI 程式碼審查開放基準
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
Chatham Financial 使用 Codex 和 GPT-5.6 建構技術並重新設計工作流程,將交易驗證時間由 30 分鐘縮短至不足 4 分鐘。
AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。
推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。
OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。
推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。
OpenAI 正為 Codex Originals 計劃徵集 Codex 使用者的真實故事。徵集對象包括開發者、創客、研究人員及創作者;有意參與計劃下一階段者可分享自己的故事與項目。
Proaction 藉助 Codex 將銷售額提升 60%,並節省 75+ 小時。Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra,加快現代化車隊管理服務的構建、營運及銷售。
Airbnb 正擴大工程團隊使用 GPT-6 Astra 及 OpenAI 前沿模型的範圍。此舉旨在協助工程團隊修復錯誤、設計系統並加快交付。
Cognition 藉助 GPT‑6 Astra 提升 Devin 測試軟件並驗證其可正常運作的能力。目標是讓工程師減少審閲程式碼,並交付更多成果。
1Password 的工程師使用 Codex 快速開發新功能和內部工具,工程生產力提升 21%。這些成果在維持嚴格安全政策的同時,已達到可投入生產環境的準備狀態。
OpenAI 內部的編碼智能體正重塑 AI 研究。早期數據涵蓋智能體使用情況、實驗速度、任務複雜度及研究加速。
GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。
推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。
OpenAI 推出 GPT-6 Astra,稱其為迄今最智能、最符合對齊要求的模型。OpenAI 表示,模型在電腦操作、編碼、網絡安全及科學領域具備最先進能力。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
loveholidays 使用 OpenAI Codex,讓公司各團隊更容易參與軟件開發。這有助團隊更快把想法轉化為產品。
Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。
推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。
GPT-5.6 現已在 Kiro 中提供,協助開發者以更佳性價比規劃、建構、審查及測試軟件。
Replit 透過由 GPT-5.6 Luna 驅動的 Free Mode 擴大軟件創作入口。Free Mode 讓任何人把想法轉化為可運作的軟件,並稱毋須擔心 token 費用。
Asana 使用 OpenAI Codex,在 2 週內替換一套過時的測試系統,並完成原需數年的程式碼遷移。此次使用的模型與基礎設施成本約為 $12K。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 產品開發,並集中工程與營運部門的營運情報。相關應用涵蓋工程至營運。
科學家正運用 AI 編碼智能體推動科學計算現代化,加快基因組學及其他領域的軟件開發與發現。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
OpenAI 的創意團隊運用 Codex 和上下文感知 AI 建構自訂創意工具、加快構思,並更快製作原型。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex,加快應對支付業務的複雜性。AP+ 節省時間、改善品質,並以人類判斷為核心。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
OpenAI 預覽新一代模型 GPT-5.6 Sol,其程式編寫、科學及網絡安全能力更強,並配備 OpenAI 最先進的安全技術堆疊。
Jason Liu 使用 Codex 保留脈絡並管理複雜專案。這讓工作得以延續至單一提示詞以外,支援長時間任務。
Samsung Electronics 向全球員工部署 ChatGPT Enterprise 和 Codex。OpenAI 稱,這是其規模最大的企業 AI 部署之一。
推薦理由:這則公告提供企業級 AI 落地的具體案例,交代 Samsung Electronics 面向全球員工部署的產品,也呈現 OpenAI 對此次部署規模的定位。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
天體物理學家 Chi-kwan Chan 使用 Codex 建構黑洞模擬,協助科學家研究極端物理,並檢驗 Einstein 的廣義相對論。
OpenAI 計劃收購 Ona,以安全、持久的雲端環境擴展 Codex。此舉將支援 AI 智能體在企業工作流程中長時間運行。
推薦理由:這宗收購把雲端環境與 Codex 的擴展連結起來,可從中瞭解 OpenAI 如何將長時間運行的 AI 智能體延伸至企業工作流程。
Nextdoor 工程師使用 Codex 搭配 GPT-5.5,調查難以重現的問題並跨平台開發。其工作亦聚焦產品成果。
JetBrains 發佈 Mellum2,一款以自然語言和程式碼從零訓練的 12B MoE 模型,每個 token 啟用 2.5B 參數。模型採 Apache 2.0 授權,適用於路由、RAG、摘要、子智能體及高吞吐程式功能等工作負載。
Braintrust 工程師使用 Codex 與 GPT-5.5,將客户需求轉化為程式碼。這項做法亦用於運行實驗,並加快編碼速度。
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。