Hugging Face Blog·· 2024-06-18AI 評分51
BigCodeBench:HumanEval 的新一代程式碼生成基準
BigCodeBench: The Next Generation of HumanEval
AI 導讀
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。
來源:Hugging Face Blog · huggingface.co