返回模型榜
評測來源
每個來源測什麼、怎樣更新、是否進入排名,都可以在這裏找到。
20本輪參與排名69已審查來源與專項
排名怎麼算 綜合評測與體驗
17跨能力的綜合測試與真人盲選。
- 參與排名AA Index把多項當前評測放到同一套環境裏復跑,得到一個綜合能力分。價格只作參考,不進總分。Artificial Analysis證據預算 30%
- 交叉參考LiveBench題庫持續更換,答案可以自動核對。用來看模型換題之後還能不能站住。LiveBench
- 參與排名Arena Text真人匿名兩兩比較回答,看大家更願意讀哪一個。補上選擇題看不出的整體體驗。LMArena證據預算 5%
- 參與排名Arena WebDev同樣是真人盲選,比的是網頁好不好用、能不能交付。LMArena證據預算 2.4%
- 參與排名LiveBench · 語言與指令Language + IF 兩項均分,各佔 50%。LiveBench證據預算 3%
- 參與排名Arena 創作盲選真人盲選故事、詩歌和其他創意表達,觀察作品是否吸引讀者。LMArena證據預算 5%
- 觀察中Design Arena · 視覺設計真人盲選網頁、界面、圖表和幻燈片的設計作品。Design Arena / Intelligence
- 觀察中EQ-Bench 4 · 情緒與人際理解在多輪交流中理解人物情緒、隱含需求與不同的溝通偏好。EQ-Bench
- 觀察中Short-Story · 短篇小説把固定人物、情節與風格要求自然寫進一篇完整短篇小説。Lech Mazur
- 觀察中ToneBench · 文風與腳本按指定作者文風寫視頻腳本,考查開場、結構、表達與口播節奏。Towards AI
- 觀察中TubeLab · 視頻腳本面向不同視頻頻道寫腳本,比較故事組織、文風、節奏與清晰度。TubeLab
- 觀察中NC Bench · 作家工作流幫助作家改寫、續寫、總結、翻譯和整理創作想法。Novelcrafter
- 觀察中OpenVibeEval · 網頁作品對照網頁作品、可訪問性和盲選偏好,觀察不同工具下的設計表現。OpenVibeEval
- 觀察中SVGBench · 矢量圖盲選按相同提示盲選 SVG,考查視覺清晰度與圖形表現。SVGBench
- 觀察中Rapidata SVG真人比較模型生成的矢量圖,直接評價視覺偏好。Rapidata
- 參與排名Creative Writing v3短篇創作與表達EQ-Bench證據預算 3.6%
- 參與排名Longform Writing長篇故事的連貫性與完整性EQ-Bench證據預算 2.4%
編程
13從寫代碼到改倉庫,看模型能不能把軟件做出來。
- 參與排名DeepSWE v1.1在統一的編程助手環境裏改倉庫、修缺陷,比較的是寫代碼的模型本身。DataCurve證據預算 3.6%
- 參與排名TapTap Maker在真實遊戲引擎裏用 Lua 寫出能跑起來的功能。分數由引擎執行判定,不用另一個模型打分。TapTap Maker證據預算 3.6%
- 參與排名LiveBench · 編程綜合Coding + Agentic Coding 兩項均分,各佔 50%。LiveBench證據預算 2.4%
- 觀察中Hyper-τ-bench根據業務資料構建並測試能工作的客户服務代理。Sierra
- 觀察中SWE-rebench持續收集真實倉庫問題,比較模型在多種編程語言中的軟件修復能力。Nebius
- 觀察中LHTB在較長時間內持續使用終端,完成複雜工程與工具任務。Tencent HY / Lehigh 等
- 僅供參考Terminal-Bench 4保留模型搭配不同 Agent 在終端任務中的原始成績,供交叉核對。Harbor / Terminal-Bench
- 僅供參考MirrorCode長時間的軟件復現Epoch AI
- 觀察中Code Migration軟件遷移與接口改造Vals AI
- 觀察中ProgramBench完整程序的實現與交付Vals AI
- 觀察中FrontierCode真實倉庫任務的質量、測試與修改範圍Cognition
- 觀察中FrontierSWE v2長時間運行的工程實現與研究任務Proximal Labs
- 觀察中WeirdML在陌生數據上實現機器學習方案WeirdML
推理
11數學、邏輯與陌生規則,看模型能不能想明白新問題。
- 參與排名LiveBench · 推理與數學Reasoning + Mathematics 兩項均分,各佔 50%。LiveBench證據預算 4.2%
- 觀察中SimpleBench用日常常識和邏輯問題,檢驗模型能否識別問題中的實際約束。SimpleBench
- 參與排名FrontierMath v2 · Tiers 1–3研究級數學推理Epoch AI證據預算 3.6%
- 參與排名FrontierMath v2 · Tier 4更高難度的數學研究題Epoch AI證據預算 1.2%
- 參與排名Chess Puzzles根據文字棋局尋找正確走法Epoch AI證據預算 1.8%
- 參與排名Mystery Game Puzzles從陌生規則推導正確行動Epoch AI證據預算 1.2%
- 觀察中MathArena · ArXivLean用 Lean 驗證數學證明MathArena / ETH Zurich
- 觀察中MathArena · BrokenArXiv發現和修復數學證明中的錯誤MathArena / ETH Zurich
- 觀察中MathArena · ArXivMath從近期數學論文提煉的新題MathArena / ETH Zurich
- 觀察中ARC-AGI-2從陌生規則中學習和泛化ARC Prize
- 觀察中ARC-AGI-3從陌生規則中學習和泛化ARC Prize
知識
5事實問答與研究生級科學知識,看知識掌握與回答準確性。
專業辦公
19金融分析、法律諮詢與銀行業務,看專業任務能否完成。
- 參與排名APEX-Agents 1.1投行、諮詢和法律裏的長任務,看模型當助手能不能把一件完整的工作做完。Mercor證據預算 4%
- 參與排名Vals Finance Agent金融分析師的日常辦公題,看研報、建模這類工作做得怎樣。Vals AI證據預算 3%
- 觀察中OfficeQA Pro從大量真實財務文件中檢索、計算並回答問題。Databricks
- 觀察中Harvey Legal Agent Benchmark處理法律資料並交付 Word、Excel、幻燈片等可審閲文件。Vals AI / Harvey
- 觀察中MCP Atlas通過真實 MCP 服務檢索資料、操作文檔與數據庫,完成跨軟件任務。Scale AI
- 觀察中FinanceBenchmark完成金融定價、資本計算和風控任務,用數值與代碼執行結果核驗。FinanceBenchmark
- 觀察中PRBench · Legal回答真實法律工作中的複雜問題,檢驗專業判斷和論證質量。Scale AI
- 觀察中PRBench · Finance回答真實金融決策問題,檢驗專業判斷、推導和風險説明。Scale AI
- 觀察中SpreadsheetBench 2完成財務建模、修復工作簿和數據可視化的整套表格工作。SpreadsheetBench / Renmin University / AfterQuery
- 觀察中Vending-Bench 2經營模擬商店一年,處理採購、談判、庫存與定價。Andon Labs
- 等待成績τ³-Banking在統一工具環境中辦理銀行業務,檢驗規則理解、客户溝通與任務完成。Sierra證據預算 2%
- 僅供參考EBR-bench在長任務中學習新規則並使用記憶Epoch AI
- 觀察中Excel · EMB表格編輯與 Excel 辦公Vals AI
- 觀察中Legal Research法律檢索和論證Vals AI
- 觀察中TaxAgentBench税務專業問題Vals AI
- 觀察中MedScribe臨牀記錄整理與撰寫Vals AI
- 觀察中BioMysteryBench生物學研究推理Vals AI
- 觀察中AutomationBench跨辦公軟件完成自動化工作Zapier
- 觀察中Terminal-Bench Science在終端裏完成科研任務Harbor
視覺理解
2理解圖片的證據繼續保留在綜合榜;讀懂圖片與設計美觀是不同能力。
中文與多語言
2語言基礎的補充證據,不把英文寫作表現當作中文能力。
“觀察中”表示仍在核對數據、運行條件或使用邊界,不參與綜合榜和分類榜。同一評測的重複抓取和展示切片不會增加票權;不同評測之間的題庫重疊仍需持續核對。