跳到正文
原文
OpenAI Developers:Blog·· 4 天前AI 評分67

Codex Agent 技能的 Evals 系統化測試實踐指南

Jan 22 Testing Agent Skills Systematically with Evals A practical guide to turning agent skills into something you can test, score, and improve over time. Codex

AI 導讀

OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。

來源:OpenAI Developers:Blog · developers.openai.com