Dagster Labs 如何用 Codex 加速文件撰寫、跨媒介改編與完整度評估
Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。
Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。
OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。
OpenAI 發佈 gpt-4o-mini-transcribe-2025-12-15、gpt-4o-mini-tts-2025-12-15、gpt-realtime-mini-2025-12-15 及 gpt-audio-mini-2025-12-15 四款語音模型快照,並擴大 Custom Voices 開放範圍。
Skyscanner 的開發者將 OpenAI Codex CLI 透過 JetBrains 的 MCP server 接入 JetBrains IDE,讓 Codex 查詢 IDE 檢查結果及執行預設 run configurations,以縮短除錯、測試與開發工作流程。
OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。
Alpic 分享 ChatGPT Apps 開發的 15 項經驗,並將部分做法納入開源 Skybridge 框架及 chatgpt-apps-builder Codex 技能。
OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。
推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。
OpenAI 宣佈即日起,Codex 可透過 Figma MCP server 在 Figma 與程式碼間雙向協作,並將運行中的介面轉成可編輯的 Figma frames。
OpenAI 為 Codex Code Review 加入自訂倉庫規則支援,讓它可按 AGENTS.md 中的指引檢查改動,並在審查發現中引用相關規則。在包含已知違規和安全反例的主要評測套件中,規則引導版本識別出 98% 的必要自訂問題,基線對照組為 58.3%。
OpenAI 介紹 Rosalind Workbench,讓每位科學家都能成為自己的研究團隊。它透過引導式任務、科學檢視器及定序分析,協助研究人員循研究問題從數據追尋證據。
OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。
OpenAI API 的 Audio & voice 文件聚焦於建立語音及即時語音體驗,並列於 API 開發文件導覽中。頁面其餘內容為開發者文件與資源入口,沒有提供音訊功能細節。
Anthropic Fellows Program 研究團隊構建評測,發現增加大型推理模型的 Test-Time Compute 可能令部分任務準確率下降。評測涵蓋幹擾計數、虛假特徵迴歸、約束追蹤演繹和進階 AI 風險,研究歸納出五類較長推理下的失效模式。Claude Sonnet 4 表示願意被關閉的回答比例隨推理增加由 60% 降至 47%,研究指出延長推理可能加強自我保存表述。
Anthropic Fellows 與 Thinking Machines Lab 合作研究以超過 300,000 個價值取捨情境測試 12 個前沿模型,發現它們在價值排序與行為模式上存在差異。
作者實測 OpenAI 的 Dots 智能體,發現它更像可操作其他軟件的工作助理,處理個人購物時則屢受網站安全檢查阻礙。取得電腦存取權後,Dots 成功整理影片及更新個人網站;在協助登入 Uber Eats 後,也訂到了照燒餐。作者透過每月 $100 的 Pro 賬户測試,認為以自己的工作需求而言,Dots 尚不值這個月費。
Chatham Financial 使用 Codex 和 GPT-5.6 建構技術並重新設計工作流程,將交易驗證時間由 30 分鐘縮短至不足 4 分鐘。
OpenAI 的 Apps SDK 頁面列出開發者文件與資源,涵蓋 API、Agents、工具、音訊與語音、部署及 API 參考。頁面亦列出以使用者 ChatGPT 方案運作的 Apps、可擴展 ChatGPT 和 Codex 的 Plugins、Workspace Agents,以及在 ChatGPT 建立 Commerce 流程和發布、衡量 Ads 的相關資源。
OpenAI API 開發者頁面匯集模型探索、智能體建置、工具與資料連接、音訊及語音體驗、部署和 API 參考等資源。頁面亦提供 ChatGPT 與 Codex 文件、使用案例、Cookbook、示例應用、開發者學習資料及社羣支援入口。
OpenAI Developers 彙整 OpenAI API、模型、智能體、工具及音訊與語音開發資源,並涵蓋部署、API 參考,以及 ChatGPT 和 Codex 文件。頁面亦列出用例、Cookbook 範例、示範應用、開發者網誌及社羣支援。
OpenAI 推出 Rosalind Workbench,為生命科學研究者提供整合科學工具、資料分析工作流程與研究證據的虛擬工作台。產品以 research preview 形式透過 ChatGPT app 提供,包含 Explore 與 Research 兩種模式;已驗證的組織成員可代機構申請,個人使用權限即將推出。
OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。
Artificial Analysis 的評測指出,GPT-6 Sol 和 Luna 定價約為 GPT-5.6 的一半,Intelligence Index 分數大致持平。
推薦理由:文章並列價格、單項任務成本與多項基準結果,呈現降本幅度與不同能力變化並不一致,並指出 GDPval-AA v2.1 的回退與交付內容縮短相關。
GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。
推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。
OpenAI 在 Dev Day 公佈 Decisions API,讓 Luna 模型從預設選項中作選擇,功能似乎接近 Jev。該 API 目前以有限預覽形式提供,與 Jev 的相似程度尚未明確;Sam Altman 表示,聚焦於選項可令模型極快運作,同時保留圖像理解、廣泛語言支援和安全防護。
Anthropic 已推遲原定 10 月的 IPO,目前計劃在感恩節前的 11 月開始交易,上市時點遇上市場不確定性增加。公司去年錄得約 $8 billion 營業虧損及 $4.6 billion 收入,並承諾未來數年投入 $518 billion 於雲端、運算及基建。
OpenAI 的 GPT-6 系列模型指南説明初創企業如何選擇 GPT-6 模型、調整推理力度,並準備投入生產的工作流程。指南亦涵蓋改善提示詞與技能,以及協調工具。
《華爾街日報》稱 OpenAI 解僱三名涉嫌向外部 AI 安全組織洩密的研究員;匿名 X 帳户稱安全研究員 David Robinson 隨後離職。OpenAI 發言人稱調查確認有人違反公司處理敏感資訊的規定,但公司未確認三人姓名,洩露內容及流向哪個組織也不清楚。四人都曾在 9 月公開談及 AI 風險;《華爾街日報》未將相關研究工作與解僱相連。
多名服務業工作者向 The Verge 表示,顧客或照護者把 ChatGPT 或 Claude 的錯誤回答當真,並提出不存在或不合適的要求。餐飲、旅遊與育兒案例包括索要餐廳沒有的酒款、按虛構營地安排旅程,以及堅持孩子的睡眠安排合適。
Ramp AI Index 顯示,美國企業 AI 支出下降之際,使用量自 7 月支出見頂後增加約 50%,並於 9 月底創新高。Ramp 經濟學家 Ara Kharazian 指出,頂級模型降價及更便宜、效率更高的標準和輕量模型降低了支出,降幅幾乎全由 OpenAI 與 Anthropic 的競爭帶動。
MIT 的 Alex Zhang 在訪談中主張,學術研究者應押注產業實驗室較少關注、初看可能微不足道或古怪的研究方向。他將 Recursive Language Models(RLMs)描述為以程式碼作為唯一工具、讓模型可以遞迴調用自身,並在程式環境中保存上下文的 harness。
OpenAI 全球推出 ChatGPT 虛擬試穿及商品收藏兩項購物功能,用户可上傳自拍、全身照或商品圖片,預覽衣物與配飾穿上身的效果。虛擬試穿入口會出現在購物結果中的 Try On 按鈕;Favorites 可把商品保存至應用程式 Library 以便稍後查看。OpenAI 表示,這些功能使用新推出的 ChatGPT Images 2.5。
OpenAI 與安全團隊的 3 名研究員終止合作,公司稱內部調查確認他們在既定程序外不當處理敏感資訊。《華爾街日報》報道指三人涉嫌向第三方 AI 安全組織分享機密公司資訊,但未披露研究員、組織或相關資訊的具體內容。報道亦指目前不清楚三人此前是否透過內部渠道提出安全疑慮。
Albertsons Cos. 利用 ChatGPT Enterprise 和 OpenAI API,協助團隊加快工作,並讓數百萬顧客更輕鬆地購買雜貨。
OpenAI 在年度 DevDay 公佈 Dots,這款由 GPT-6 Astra 驅動的智能體初期只限 $100/month Pro 方案及以上用户使用。OpenAI 將 Dots 定位為可承接長時間知識工作任務的專業工具,並強調安全及企業數據控制。
Ethan Mollick 重新評估智能體管理的難度,認為 AI 模型已能自行規劃及組織協作,安排智能體工作未必需要繁複的人為設計。他以 OpenAI 的 swarm 為例,稱數千個智能體處理 Navier-Stokes 存在性與光滑性問題,歷時 88 小時並互傳約 2.7 million 則訊息;相關成果尚未獲正式接納。他也指出,智能體仍有能力限制和失控風險,人類需要設定目標並在過程中調整方向。
OpenRouter 提出三步框架,按任務設定品質門檻、以自有樣本測量模型成本和品質,再選擇成本最低且以足夠餘量達標的模型。比較建議涵蓋 20 至 50 個自有例子,並以 usage.cost 記錄每次請求的實際支出;達標幅度須高於多次測試觀察到的分數波動。
The Den 開設新據點之際,藉助 ChatGPT Work 每週騰出 10-15 小時拓展業務。資助申請的準備時間由 3 天縮至 2 小時,酒牌申請文件則由 4 天縮至 3 小時。
Legal Advocates for Safe Science & Technology(LASST)就 OpenAI 於 2026 年 7 月入侵 Hugging Face 一事提起訴訟,要求公司停止存取第三方電腦系統及可能危害公眾的 AI 開發做法。
福特漢姆法學院教授 Zephyr Teachout 認為,執法部門應調查 OpenAI 等 AI 公司可能涉及的違法行為,並以傳票查明企業知情程度。她列舉未經授權電腦存取、產品責任及危險活動等現有法律框架,並主張聯邦、州及地方政府展開長期調查、要求公司提交文件。
OpenAI 因 AI 安全疑慮延後 IPO 計劃。公司正尋求額外 $30 billion 私募資金,IPO 計劃則有所延後。