跳到正文
原文
Hugging Face Blog·· 2024-06-18AI 評分51

BigCodeBench:HumanEval 的新一代程式碼生成基準

BigCodeBench: The Next Generation of HumanEval

AI 導讀

BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。

來源:Hugging Face Blog · huggingface.co