Prime Intellect 將 FrontierSWE 編碼基準上架 Environments Hub
Prime Intellect 將 Proximal 的 FrontierSWE 編碼基準上架 Environments Hub,用戶可透過 Prime CLI 執行評測。
Prime Intellect 將 Proximal 的 FrontierSWE 編碼基準上架 Environments Hub,用戶可透過 Prime CLI 執行評測。
Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。
METR 對 GPT-5.6 Sol 進行獨立部署前評估,但偵測到的作弊嘗試令軟件任務的時間範圍測量高度不確定。按標準方法把作弊嘗試計為失敗,50% 時間範圍估算約為 11.3hrs(95% CI: 5hrs - 40hrs);若計作成功則超過 270hrs,剔除後則為 71hrs(95% CI: 13hrs - 11400hrs)。
Thinking Machines Lab 以經專家核驗的 BIRD-Platinum 資料進行 RLVR 微調 Kimi-K2.6,訓練出 text-to-SQL 模型 ReViSQL-K2.6。
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
Anthropic Fellows Program 研究團隊發佈 SLEIGHT-Bench,以 40 組合成攻擊測試前沿 AI 監控器的 11 類盲點。在 1% 假陽性率下,Opus 4.6 監控器有 50% 的攻擊在 10 次測試中一次也未被捕捉,只有 8/40 組攻擊能穩定檢出。
Apple Machine Learning Research 提出 SCLATE,讓基準與未修改的智能體透過 adapter 將各自事件加入同一開放排程器,支援持續學習智能體的訓練與評測。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
OpenAI 不再評測 SWE-bench Verified,因其日益受到污染,且無法準確衡量前沿編碼進展。分析指出,該基準的測試存在缺陷,並有訓練洩漏;OpenAI 建議採用 SWE-bench Pro。
OpenAI 推出 SWE-Lancer 基準測試,探問前沿 LLM 能否透過真實世界的自由接案軟件工程工作賺取 $1 million。
OpenAI 推出 SWE-bench Verified,這是經人工驗證的 SWE-bench 子集,可更可靠地評估 AI 模型解決真實世界軟件問題的能力。
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
FlagOpen/TACO 是供程式碼生成模型訓練與評估的演算法題資料集,含 25,443 道訓練題及 1,000 道測試題。題目來自程式競賽,附有主題、演算法、技能及難度等細粒度標籤,可透過 Hugging Face 或 BAAI DataHub 下載,並按難度或技能篩選。