跳到正文
原文
Hugging Face Blog·· 2026-06-18精選AI 評分68

Hugging Face 以 agent-eval 評測開源模型操作 transformers 的成功率與成本

Is it agentic enough? Benchmarking open models on your own tooling

AI 導讀

Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。

推薦理由

評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。

來源:Hugging Face Blog · huggingface.co