跳到正文
原文
Ai2 / Allen Institute for AI·· 2026-09-01AI 評分54

BenchMIRT:LLM 基準測試實際測量甚麼?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 導讀

Ai2 介紹 BenchMIRT,一種逐題分析 LLM 基準測試的方法,並從模型作答中辨識出安全與一般推理兩個主要能力維度。BenchMIRT 以 100 個 LLM、16 個基準及逾 34K 道題目的評測結果訓練;分析發現 BBQ 和 WMDP 的分數與一般推理的關聯強於安全。

來源:Ai2 / Allen Institute for AI · allenai.org