GitHub 推出 ReviewBench,作為 AI 程式碼審查開放基準
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
LlamaIndex 發佈 ParseBench,這是一項面向 AI 智能體的文件解析基準,包含約 2,000 頁人工核驗的企業文件和超過 167,000 條測試規則。它從表格、圖表、內容忠實度、語義格式及視覺定位五個維度評估 14 種方法;LlamaParse Agentic 整體得分為 84.9%,是五個關鍵維度均具競爭力的唯一受測方法。基準資料集、評估程式碼和完整研究論文均已公開。
Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
FlagOpen/TACO 是供程式碼生成模型訓練與評估的演算法題資料集,含 25,443 道訓練題及 1,000 道測試題。題目來自程式競賽,附有主題、演算法、技能及難度等細粒度標籤,可透過 Hugging Face 或 BAAI DataHub 下載,並按難度或技能篩選。
MTEB 是一套評估文本嵌入模型在多種任務上表現的大型基準測試,並以排行榜彙整模型成績。該基準涵蓋 56 個數據集、8 類任務及最多 112 種語言,排行榜彙整 >2000 項結果。
推薦理由:MTEB 把 56 個數據集、8 類任務納入同一排行榜,並提供自行測試及提交結果的流程,方便按具體任務比較文本嵌入模型。