跳到正文
原文
Amazon Science·· 2026-08-21AI 評分64

Amazon 發佈 SOP-Bench 基準,評估 AI 智能體執行真實業務程序的能力

SOP-Bench: A new benchmark for evaluating AI agents on real business procedures

AI 導讀

Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。

來源:Amazon Science · amazon.science