評測來源官方評測
Humanity’s Last Exam
CAIS / Scale AI / 知識 · 橫跨學科的高難度學術知識與推理。
在 ATech Hot 中觀察中
證據預算不計分
上游數據時間待核實
最近成功同步尚未開始採集
它測什麼,怎麼測
固定題集、工具條件和裁判;HLE、HLE-Rolling 與帶工具結果分別比較。AA v4.3 已包含 HLE,將來若有可用專項成績,只用於分類,不在綜合榜重複計票。
如何使用這份證據
觀察中:官方已補充部分新品,原始成績仍缺少可驗證的評測日期;不套用 Epoch 自評數據許可,不把已有 AA 綜合證據再次加分。
評測侷限與數據署名
觀察中:官方已補充部分新品,原始成績仍缺少可驗證的評測日期;不套用 Epoch 自評數據許可,不把已有 AA 綜合證據再次加分。
數據許可:評測代碼 MIT;官方榜單成績再展示邊界尚待確認。
成績由 CAIS / Scale AI 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。