ScarfBench:企業 Java 框架遷移 AI 智能體基準測試
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。