Ai2 / Allen Institute for AI·· 2026-09-01AI 評分54
BenchMIRT:LLM 基準測試實際測量甚麼?
BenchMIRT: What are LLM benchmarks actually measuring?
AI 導讀
Ai2 介紹 BenchMIRT,一種逐題分析 LLM 基準測試的方法,並從模型作答中辨識出安全與一般推理兩個主要能力維度。BenchMIRT 以 100 個 LLM、16 個基準及逾 34K 道題目的評測結果訓練;分析發現 BBQ 和 WMDP 的分數與一般推理的關聯強於安全。
來源:Ai2 / Allen Institute for AI · allenai.org