熱點事件觀察中
Epoch AI 評估六款模型自動化工作能力
1 篇報道1 個報道來源1 天前更新
先了解這件事
AI 綜述
2026年10月8日,Epoch AI以11項源自自身工作的任務,評估六款模型自動化工作的能力。結果顯示,Fable 5.1和GPT-6 Astra在定義清晰的任務上較可靠,但仍難以處理需要判斷的開放式工作。開放權重模型表現落後,連封閉權重模型能可靠完成的明確任務也較難應付。每款模型在每項任務上只測試一次,評分亦包含主觀判斷;報告指出,結果不代表AI在所有工作上的能力。
AI 根據報道生成 · 45 分鐘前更新
最新進展10月8日 00:00
評估顯示,Fable 5.1和GPT-6 Astra較可靠地完成明確任務,但仍難處理開放式工作。報道時間線
沿着報道,瞭解事件的不同側面。
10月8日
- Epoch AI:研究、數據與評測Epoch AI 評估六款模型自動化其工作的能力
Epoch AI 以 11 項源自自身工作的任務評估六款模型,發現 Fable 5.1 和 GPT-6 Astra 在定義清晰的任務上較可靠,但仍難以處理開放式工作的判斷要求。開放權重模型表現落後,連封閉權重模型能可靠完成的明確任務也較難應付。每款模型每項任務只測試一次,評分亦包含主觀判斷;報告指出,結果不代表 AI 在所有工作上的能力。
本事件熱度走勢
還沒有足夠的連續觀測數據,暫不繪製趨勢。