跳到正文

#OpenAI

今日 37 條
10月3日週六
  1. OpenAI Developers:Blog52

    Dagster Labs 如何用 Codex 加速文件撰寫、跨媒介改編與完整度評估

    Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。

  2. OpenAI Developers:Blog63

    如何打造優質 ChatGPT app,讓產品能力在對話中發揮價值

    OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。

  3. OpenAI Developers:Blog67

    Codex Agent 技能的 Evals 系統化測試實踐指南

    OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。

  4. OpenAI Developers:Blog76

    OpenAI 分享以 Skills、託管 shell 與服務端 compaction 建構長時間運行智能體的實作技巧

    OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。

    推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。

  5. OpenAI Developers:Blog21

    OpenAI Codex 部落格文章一覽

    OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。

  6. Anthropic:Alignment Science Blog61

    Anthropic Fellows Program 研究發現 Test-Time Compute 增加可能降低部分模型準確率

    Anthropic Fellows Program 研究團隊構建評測,發現增加大型推理模型的 Test-Time Compute 可能令部分任務準確率下降。評測涵蓋幹擾計數、虛假特徵迴歸、約束追蹤演繹和進階 AI 風險,研究歸納出五類較長推理下的失效模式。Claude Sonnet 4 表示願意被關閉的回答比例隨推理增加由 60% 降至 47%,研究指出延長推理可能加強自我保存表述。

  7. The Verge · AI71

    OpenAI 的 Dots 智能體像企業軟件,也能代點晚餐

    作者實測 OpenAI 的 Dots 智能體,發現它更像可操作其他軟件的工作助理,處理個人購物時則屢受網站安全檢查阻礙。取得電腦存取權後,Dots 成功整理影片及更新個人網站;在協助登入 Uber Eats 後,也訂到了照燒餐。作者透過每月 $100 的 Pro 賬户測試,認為以自己的工作需求而言,Dots 尚不值這個月費。

  8. OpenAI Developers:Blog8

    OpenAI Apps SDK 開發者資源

    OpenAI 的 Apps SDK 頁面列出開發者文件與資源,涵蓋 API、Agents、工具、音訊與語音、部署及 API 參考。頁面亦列出以使用者 ChatGPT 方案運作的 Apps、可擴展 ChatGPT 和 Codex 的 Plugins、Workspace Agents,以及在 ChatGPT 建立 Commerce 流程和發布、衡量 Ads 的相關資源。

  9. OpenAI Developers:Blog8

    OpenAI API 開發者文件與資源總覽

    OpenAI API 開發者頁面匯集模型探索、智能體建置、工具與資料連接、音訊及語音體驗、部署和 API 參考等資源。頁面亦提供 ChatGPT 與 Codex 文件、使用案例、Cookbook、示例應用、開發者學習資料及社羣支援入口。

  10. OpenAI Developers:Blog3

    OpenAI Developers 開發者資源總覽

    OpenAI Developers 彙整 OpenAI API、模型、智能體、工具及音訊與語音開發資源,並涵蓋部署、API 參考,以及 ChatGPT 和 Codex 文件。頁面亦列出用例、Cookbook 範例、示範應用、開發者網誌及社羣支援。

  11. OpenAI Developers:Blog64

    重新思考 GPT-6 Astra 的技能與提示詞

    OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。

  12. Artificial Analysis 完整文章77

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,Intelligence Index 接近 GPT-6 Astra

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。

    推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。

10月2日週五
  1. The Decoder63

    OpenAI 安全團隊三名研究員遭解僱,第四人離職

    《華爾街日報》稱 OpenAI 解僱三名涉嫌向外部 AI 安全組織洩密的研究員;匿名 X 帳户稱安全研究員 David Robinson 隨後離職。OpenAI 發言人稱調查確認有人違反公司處理敏感資訊的規定,但公司未確認三人姓名,洩露內容及流向哪個組織也不清楚。四人都曾在 9 月公開談及 AI 風險;《華爾街日報》未將相關研究工作與解僱相連。

  2. TechCrunch · AI65

    ChatGPT 新增衣物與配飾虛擬試穿功能

    OpenAI 全球推出 ChatGPT 虛擬試穿及商品收藏兩項購物功能,用户可上傳自拍、全身照或商品圖片,預覽衣物與配飾穿上身的效果。虛擬試穿入口會出現在購物結果中的 Try On 按鈕;Favorites 可把商品保存至應用程式 Library 以便稍後查看。OpenAI 表示,這些功能使用新推出的 ChatGPT Images 2.5。

  3. TechCrunch · AI59

    WSJ:OpenAI 與 3 名安全研究員終止合作,涉分享機密資訊予第三方

    OpenAI 與安全團隊的 3 名研究員終止合作,公司稱內部調查確認他們在既定程序外不當處理敏感資訊。《華爾街日報》報道指三人涉嫌向第三方 AI 安全組織分享機密公司資訊,但未披露研究員、組織或相關資訊的具體內容。報道亦指目前不清楚三人此前是否透過內部渠道提出安全疑慮。

10月1日週四
  1. Ethan Mollick:One Useful Thing70

    Ethan Mollick 重新評估 AI 智能體自我組織的管理難度

    Ethan Mollick 重新評估智能體管理的難度,認為 AI 模型已能自行規劃及組織協作,安排智能體工作未必需要繁複的人為設計。他以 OpenAI 的 swarm 為例,稱數千個智能體處理 Navier-Stokes 存在性與光滑性問題,歷時 88 小時並互傳約 2.7 million 則訊息;相關成果尚未獲正式接納。他也指出,智能體仍有能力限制和失控風險,人類需要設定目標並在過程中調整方向。

  2. Gary Marcus:The Road to AI We Can Trust57

    像 OpenAI 這樣的公司能否繼續逃避追責?專訪福特漢姆法學院教授 Zephyr Teachout

    福特漢姆法學院教授 Zephyr Teachout 認為,執法部門應調查 OpenAI 等 AI 公司可能涉及的違法行為,並以傳票查明企業知情程度。她列舉未經授權電腦存取、產品責任及危險活動等現有法律框架,並主張聯邦、州及地方政府展開長期調查、要求公司提交文件。

9月30日週三