跳到正文
評測來源

EQ-Bench 4 · 情緒與人際理解

EQ-Bench · 在多輪交流中理解人物情緒、隱含需求與不同的溝通偏好。

官方評測
在 ATech Hot 中觀察中
證據預算不計分
上游數據時間待核實
最近成功同步尚未開始採集

它測什麼,怎麼測

120 個模擬人物、16 輪角色扮演,三家模型裁判輪換盲評;只採用 Elo,行為風格 traits 不作越高越好的能力分。舊 v3 不重複計票。

如何使用這份證據

觀察中:公開數據和許可可用,等待新一輪評測;不延長有效期來湊分類來源數。

評測侷限與數據署名

英文模擬交流且尚未用人類專家驗證,不能等同真人滿意度或中文情商;當前成績已超 45 天窗口。

數據許可:MIT · EQ-bench-site README 元數據聲明

成績由 EQ-Bench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。