GitHub 推出 ReviewBench,作為 AI 程式碼審查開放基準
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
Together AI 推出 Together Link,讓團隊在現有編碼智能體工具中接入 Together AI 的開源模型,並稱可削減逾 50% 開支。它支援 Claude Code、Claude Desktop、Codex(ChatGPT app 和 CLI)、OpenCode 及 Pi,並保留原有設定和登入方式。
MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。
推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。
Pop!_OS 禁止在其大部分程式碼庫中使用 AI 生成的程式碼。評論推測,Pop!_OS 和 Cosmic 市場佔有率偏低,較少成為攻擊者及不良行為者的目標,因此項目可以只接納人手編寫的程式碼。
Anthropic 為 Claude Code 推出 Mods 系統,讓開發者透過外掛在工具內自訂介面和工作方式。Mods 是以 JavaScript 或 TypeScript 編寫、掛接工具呼叫、使用者提示詞及介面渲染等事件的函數,可加入聊天旁的自訂面板、攔截工具呼叫或新增命令,支援 CLI、桌面應用程式,並部分支援 VS Code 擴充功能。
OpenAI 發佈 GPT-6 系列模型指南,介紹按工作負載選擇模型、優化提示詞及調整推理強度的方法。指南推薦 GPT-6 Astra 處理高難度推理、GPT-6.1 Sol 處理複雜編程、研究和電腦使用,GPT-6 Luna 則用於大規模特定任務及明確的日常重複工作。提示詞應交代期望結果、受眾、上下文、限制及完成標準;最高推理強度適合複雜分析、除錯或深度研究。
Hacker News 的提問者詢問,有沒有人能用編碼智能體產出優質程式碼,並表示這是他從資深工程師處聽到的真實難題。他稱 AI 生成的程式碼常繁複且充滿陷阱,審查 Claude merge requests 要多花 5x 時間,自己仍難以理解批准的改動。他質疑解法是否只能達到「level 4 autonomy」,不再閲讀或編寫程式碼,並求助已解決此問題的人。
LlamaIndex 推出 AutoTranslateDoc 命令列工具,可從 GitHub 儲存庫擷取 .md 和 .mdx 文件,並使用 GPT-3.5、GPT-4 分段翻譯。
作者認為,Vibe Coding 並不足以支撐嚴肅系統開發,AI 編碼仍需精確規格、獨立驗證與增量學習。文章提到,一位使用多個 AI 智能體的人估計每日產出 12,000 行程式碼,作者指出瓶頸在規格、驗證與發布。他主張把規格納入版本控制,在部署流程自行執行測試,並透過小步變更持續收集回饋。
Tessl 研究員兼工程師提出 Harness Engineer 角色,主張 AI 智能體愈多負責編碼,工程重心愈轉向設計和管理其運行系統。他將相關工作歸納為明確系統不變條件、分析智能體及程式碼數據、按風險安排審核;Tessl 以約 1,000 個開源技能測試智能體,發現平均只有約 70% 的技能指令獲遵循。
LlamaIndex 提供 Azure Code Interpreter 工具,讓智能體透過 Azure Container Apps dynamic sessions 沙箱執行 LLM 生成的程式碼。文章示範如何設定工具並接入 ReActAgent,讓智能體查詢西雅圖當前時間,以及讀取、排序和下載 CSV 檔案。
Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。
Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。
Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。
Skyscanner 的開發者將 OpenAI Codex CLI 透過 JetBrains 的 MCP server 接入 JetBrains IDE,讓 Codex 查詢 IDE 檢查結果及執行預設 run configurations,以縮短除錯、測試與開發工作流程。
OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。
Alpic 分享 ChatGPT Apps 開發的 15 項經驗,並將部分做法納入開源 Skybridge 框架及 chatgpt-apps-builder Codex 技能。
OpenAI 宣佈即日起,Codex 可透過 Figma MCP server 在 Figma 與程式碼間雙向協作,並將運行中的介面轉成可編輯的 Figma frames。
OpenAI 為 Codex Code Review 加入自訂倉庫規則支援,讓它可按 AGENTS.md 中的指引檢查改動,並在審查發現中引用相關規則。在包含已知違規和安全反例的主要評測套件中,規則引導版本識別出 98% 的必要自訂問題,基線對照組為 58.3%。
OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。
Justin 推出 Breadcrumb,一款為 Mac 設計的本機工具,可記錄螢幕、會議及 AI 對話與操作,並整理為 AI 可搜尋的記憶和上下文規則。作者舉例,Claude 讀取會議記錄、調取螢幕時間線並檢查程式碼後,建立 14 張 JIRA 工單、附上 12 張截圖,並草擬 Slack 訊息。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
MiniMax 發佈 M2.1,着重提升多語言編程、Web 和 App 開發,以及真實複雜任務中的可用性。M2.1 在 VIBE 基準五個子集的平均得分為 88.6,並在多語言場景超越 Claude Sonnet 4.5、接近 Claude Opus 4.5。
MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。
推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。
Anthropic Fellows Program 研究團隊發佈 SLEIGHT-Bench,以 40 組合成攻擊測試前沿 AI 監控器的 11 類盲點。在 1% 假陽性率下,Opus 4.6 監控器有 50% 的攻擊在 10 次測試中一次也未被捕捉,只有 8/40 組攻擊能穩定檢出。
Microsoft 發佈 MAI-Code-1-Flash,並稱其在同一 production harness 下的 4 項核心編碼評測中均勝過 Claude Haiku 4.5。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Chatham Financial 使用 Codex 和 GPT-5.6 建構技術並重新設計工作流程,將交易驗證時間由 30 分鐘縮短至不足 4 分鐘。
Tessl提出回饋迴路工程,透過設計智能體周邊的迴路,讓每次執行改善後續工作的項目條件。文章把迴路分為單次改動、跨項目歷史及生產訊號三層,維護智能體分析日誌、PR 評論或程式庫狀態後,會把需修正事項整理成一般問題單交回既有開發流程,而不自行開 PR。
智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。
推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。
作者把親自使用 AI 智能體所構建的軟件、判斷體驗並反覆修整,視為 compound engineering 的最後一步。他以 `/ce-polish` 檢出分支、啟動開發伺服器,並在編輯器中與智能體並排查看應用程式。在 Cora Brief 中,他透過 Monologue 指出版面留白過多、卡片需要更緊湊,智能體調整版面後,應用程式隨即熱重載。
OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
Artificial Analysis 的評測指出,GPT-6 Sol 和 Luna 定價約為 GPT-5.6 的一半,Intelligence Index 分數大致持平。
推薦理由:文章並列價格、單項任務成本與多項基準結果,呈現降本幅度與不同能力變化並不一致,並指出 GDPval-AA v2.1 的回退與交付內容縮短相關。
GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。
推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。
Microsoft 發佈 MAI-Code-1.1-Flash,稱其相較 6 月在 Microsoft Build 推出的 1.0,價格降至四分之一,完成任務所用 tokens 減少 25%。
Microsoft AI 發佈 MAI-Thinking-1,一款 35B-active、~1T-total parameters 的 sparse Mixture of Experts 推理模型。
Microsoft 介紹整合於 MDASH 的 MAI-Cyber-1-Flash,稱其可處理最多 90% 的任務,並讓 GPT-5.4 應對最難的 10%。Microsoft 稱,這種多模型配置較 MDASH 現有最佳方案(GPT 5.4 + 5.4 mini + 5.3 codex)節省 50% 成本。