跳到正文
評測來源

BullshitBench v2

Peter Gostev / BullshitBench / 知識 · 識別問題裏的錯誤前提,觀察模型會不會順着錯誤繼續編造。

官方評測
在 ATech Hot 中觀察中
證據預算不計分
上游數據時間待核實
最近成功同步尚未開始採集

它測什麼,怎麼測

採用官方默認的全部嘗試中明確識別比例,並保留已作答回應平均分;拒答比例保留供審計。兩項原始指標不進入當前綜合或分類票權。

如何使用這份證據

原始成績參考:按同一公開數據版本核對彙總、題集、配置與運行日期後自動採集。匿名型號不公開,無法確認固定版本的滾動接口不作為模型代表成績;當前不進入綜合或分類分數。

評測侷限與數據署名

全部為錯誤前提題,不能代表一般知識廣度;模型裁判和拒答處理影響結果,滾動別名及匿名型號須先完成身份核驗。

數據許可:MIT · Copyright (c) 2026 Peter Gostev;官方成績隨同倉庫發佈,無單獨數據許可例外。

成績由 Peter Gostev / BullshitBench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。