Hugging Face Blog·· 2025-10-07精選AI 評分66
BigCodeArena 以實際執行程式碼端到端評估程式生成模型
BigCodeArena: Judging code generations end to end with code executions
AI 導讀
BigCodeArena 推出以程式碼實際執行評估程式生成模型的平台,讓使用者並排比較模型、測試輸出並投票。平台支援 10 種語言和 8 種執行環境,並已收集逾 14,000 段對話及 4,731 個投票樣本。
推薦理由
平台把程式實際執行和互動測試納入模型比較,並按程式語言與執行環境拆分結果,呈現總體排名之外的表現差異。
來源:Hugging Face Blog · huggingface.co