跳到正文
原文
Hugging Face Blog·· 2025-10-07精選AI 評分66

BigCodeArena 以實際執行程式碼端到端評估程式生成模型

BigCodeArena: Judging code generations end to end with code executions

AI 導讀

BigCodeArena 推出以程式碼實際執行評估程式生成模型的平台,讓使用者並排比較模型、測試輸出並投票。平台支援 10 種語言和 8 種執行環境,並已收集逾 14,000 段對話及 4,731 個投票樣本。

推薦理由

平台把程式實際執行和互動測試納入模型比較,並按程式語言與執行環境拆分結果,呈現總體排名之外的表現差異。

來源:Hugging Face Blog · huggingface.co