跳到正文
原文
Hugging Face Blog·· 2026-09-02AI 評分50

BenchMIRT:LLM 基準測試實際衡量甚麼?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 導讀

AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。

來源:Hugging Face Blog · huggingface.co