跳到正文
返回模型榜

評測來源

每個來源測什麼、怎樣更新、是否進入排名,都可以在這裏找到。

20本輪參與排名69已審查來源與專項
排名怎麼算

綜合評測與體驗

17

跨能力的綜合測試與真人盲選。

編程

13

從寫代碼到改倉庫,看模型能不能把軟件做出來。

推理

11

數學、邏輯與陌生規則,看模型能不能想明白新問題。

知識

5

事實問答與研究生級科學知識,看知識掌握與回答準確性。

專業辦公

19

金融分析、法律諮詢與銀行業務,看專業任務能否完成。

視覺理解

2

理解圖片的證據繼續保留在綜合榜;讀懂圖片與設計美觀是不同能力。

中文與多語言

2

語言基礎的補充證據,不把英文寫作表現當作中文能力。

“觀察中”表示仍在核對數據、運行條件或使用邊界,不參與綜合榜和分類榜。同一評測的重複抓取和展示切片不會增加票權;不同評測之間的題庫重疊仍需持續核對。