Sierra:Blog· Ben Shi, Keshav Dhandhania·· 28 天前AI 評分60
Hyper-𝜏-bench 評估模型建構智能體的能力
Hyper-𝜏-bench: Evaluating agents that build agents
AI 導讀
Sierra 開源 Hyper-𝜏-bench(發表名稱為 𝜏^𝜏-bench),評估模型能否建構客服智能體,而不只是充當智能體。測試把開發智能體放進模擬業務沙盒,要求它從證據還原規格、設計架構並完成客服智能體,再以開發期間未見的測試檢驗成品。
來源:Sierra:Blog · sierra.ai