跳到正文
評測來源

Vals Finance Agent

Vals AI / 專業辦公 · 金融分析師的日常辦公題,看研報、建模這類工作做得怎樣。

官方評測
在 ATech Hot 中參與排名
證據預算3%
上游數據時間10/01 08:00
最近成功同步10/03 08:05

它測什麼,怎麼測

只取 Finance Agent v2 官方 Overall 正確率。

如何使用這份證據

行業專業任務預算 3%;目前直接測金融,不宣稱已經覆蓋全部行業。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1google/gemini-4-argongoogle65.4%High 推理
2google/gemini-3.8-flashGoogle61.4%High 推理
3meta/muse_spark_1_2Meta60.6%xHigh 推理
4meta/muse_spark_1_3_maxMeta60.0%Max 推理
5google/gemini-3.7-flashGoogle59.0%High 推理
7anthropic/claude-fable-5-1Anthropic58.9%Max 推理
8anthropic/claude-opus-5Anthropic58.6%Max 推理
9anthropic/claude-opus-5-5Anthropic58.6%Max 推理
10anthropic/claude-sonnet-5-5anthropic58.1%Max 推理
11google/gemini-3.5-flashGoogle57.9%High 推理
12zai/glm-5.3-flashZ.ai57.9%Max 推理
13xiaomi/mimo-v2.6-proXiaomi57.3%來源默認配置
14meta/muse_spark_1_1Meta57.2%xHigh 推理
15anthropic/claude-fable-5Anthropic56.3%Max 推理
16google/gemini-3.6-flashGoogle56.3%High 推理
17xiaomi/mimo-v2.6-flashXiaomi56.3%來源默認配置
18zai/glm-5.3Z.ai55.8%Max 推理
19tencent/hy4-previewTencent55.1%來源默認配置
20openai/gpt-5.6-lunaOpenAI55.0%Max 推理
21ant/ling-3.0-flash-af-rc3Ant54.9%來源默認配置
22openai/gpt-5.6-terraOpenAI54.4%Max 推理
23anthropic/claude-opus-4-8Anthropic53.9%Max 推理
24anthropic/claude-sonnet-5Anthropic53.9%Max 推理
25openai/gpt-5.6-solOpenAI53.8%Max 推理
26grok/grok-4.6xAI53.7%High 推理
27openai/gpt-6-astraOpenAI53.5%Max 推理
28deepseek/deepseek-v4.1-flashDeepSeek53.5%High 推理
29kimi/kimi-k3Moonshot AI53.1%Max 推理
30grok/grok-4.7xAI52.3%xHigh 推理
31openai/gpt-6.1-solopenai52.0%Max 推理
評測侷限與數據署名

私有題不能逐題復算;與 APEX 同屬辦公任務,必須共用一組預算。

數據許可:官方公開結果;公開再展示保留官方署名,完整再分發授權仍以 Vals 條款為準

成績由 Vals AI 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。