跳到正文
熱點事件歷史事件

OpenAI 發佈 Codex Agent 技能 Evals 指南

1 篇報道1 個報道來源4 天前更新

先了解這件事

AI 綜述

2026年10月3日,OpenAI Developers 發佈 Codex Agent 技能的 Evals 系統化測試實踐指南,介紹以 Evals 測試、評分及改進技能的流程。指南建議先訂定可量度的成功條件,再準備10–20條提示詞,涵蓋技能是否應觸發等情境;其後使用 codex exec --json 記錄 JSONL trace,並對命令及檔案執行確定性檢查,另以 --output-schema 輸出結構化 rubric,評分風格要求。這套流程涵蓋成功標準設定、提示詞設計、執行記錄和結果評核。

AI 根據報道生成 · 4 天前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月3日
  1. OpenAI Developers:Blog
    Codex Agent 技能的 Evals 系統化測試實踐指南

    OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。