OpenAI 與 Apollo Research 研究 AI 模型 scheming 的檢測與減緩
Apollo Research 與 OpenAI 開發了用於評估 AI 模型隱蔽失配(scheming)的測試,並在前沿模型的受控測試中發現與 scheming 一致的行為。團隊分享了具體案例,以及一種早期減少 scheming 方法的壓力測試。
推薦理由:材料同時呈現前沿模型受控測試中與 scheming 一致的行為,以及早期減緩方法的壓力測試,便於對照檢測與幹預研究的範圍。
Apollo Research 與 OpenAI 開發了用於評估 AI 模型隱蔽失配(scheming)的測試,並在前沿模型的受控測試中發現與 scheming 一致的行為。團隊分享了具體案例,以及一種早期減少 scheming 方法的壓力測試。
推薦理由:材料同時呈現前沿模型受控測試中與 scheming 一致的行為,以及早期減緩方法的壓力測試,便於對照檢測與幹預研究的範圍。
OpenAI 正為 ChatGPT 開發年齡預測及家長控制功能。這些新工具旨在為青少年提供更安全、符合年齡的使用體驗,同時支援家庭。
OpenAI 闡述其在青少年使用 AI 時平衡安全、自由與私隱的做法。
OpenAI 為 Codex 推出升級,提升速度、可靠性、即時協作能力,以及在不同開發環境中獨立處理任務的能力。使用者可透過終端、IDE、網頁或手機使用 Codex。
涵蓋 ChatGPT 使用情況的最大規模研究顯示,ChatGPT 透過個人及專業用途創造經濟價值。採用範圍正擴展至早期使用者以外、縮小差距,並令 AI 成為日常生活的一部分。
OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。
推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。
OpenAI 分享與美國 CAISI 及英國 AISI 合作、加強 AI 安全與資訊安全的進展。合作旨在打造更安全的 AI 系統。
OpenAI 與 Microsoft 簽署新的 MOU,重申雙方夥伴關係及共同承諾。這項共同承諾涵蓋 AI 安全與創新。
OpenAI 重申非牟利組織的領導地位,並提出涉及其 PBC 股權安排的新架構,使逾 $100B 資源可用於推進安全、有益於人類的 AI。
推薦理由:這項安排把 OpenAI 的非牟利領導、PBC 股權安排與逾 $100B 資源連結,呈現其組織架構及推進安全、有益於人類的 AI 的資源配置。
OpenAI 的 People-First AI Fund 現正開放申請,以 $50M 支持推動教育、社區創新及經濟機會的美國非營利組織。申請截止日期為 2025 年 10 月 8 日,資助不限定用途,協助社區塑造造福公眾的 AI。
OpenAI 新研究解析語言模型產生幻覺的原因。研究結果顯示,改進評測可提升 AI 的可靠性、誠實度與安全性。
OpenAI 與希臘政府推出「OpenAI for Greece」,將 ChatGPT Edu 引入中學並支持負責任的 AI 學習。這項合作旨在提升 AI 素養、帶動本地初創企業發展,並推動希臘經濟增長。
OpenAI 推出 Jobs Platform 和新認證,連接勞動者與工作、培訓及認證。這項措施旨在擴大經濟機會,並讓 AI 技能更容易取得。
OpenAI 正與專家合作,透過家長控制加強對青少年的保護,並在 ChatGPT 將敏感對話轉交推理模型處理。這些措施旨在為所有人打造更有幫助的 ChatGPT 體驗。
OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。
推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。
OpenAI 推出 $50M People-First AI Fund,協助美國非營利組織運用 AI 擴大影響。申請將於 2025 年 9 月 8 日至 10 月 8 日開放,資助範圍涵蓋教育、醫療、研究等領域。
OpenAI 與 Anthropic 分享首個同類聯合安全評估的結果,雙方互相測試對方的模型。評估涵蓋對齊失準、指令遵循、模型幻覺與越獄等,並呈現相關進展、挑戰及跨實驗室合作的價值。
OpenAI 説明其對正經歷心理或情緒困擾用户安全的考量。現有系統仍有侷限,相關完善工作正在進行。
Blue J 憑藉專注、領域深度及合適的 OpenAI 模型,拓展至 3 個國家和超過 3,000 家企業。其擴張聚焦複雜且受監管的領域。
日本數碼娛樂與生活服務企業 MIXI 以 ChatGPT 重新構想溝通方式,並透過 ChatGPT Enterprise 提升生產力。MIXI 同時推動各團隊採用 AI,並建立安全的創新環境。
OpenAI 的速率限制指南説明 API 限額依組織、專案及模型而異,並整理常見限額指標與錯誤處理方式。限額指標包括 RPM、RPD、TPM、TPD、IPM,以及部分串流音訊模型的每分鐘音訊分鐘數;API 支出增加後會自動升至更高 usage tier,通常提高大部分模型的速率限制。
OpenAI 致函加州州長 Gavin Newsom,呼籲加州帶頭協調州級 AI 監管制度。信中主張州級規範應與美國國家標準接軌,並對齊在美國領導下正在形成的新興全球標準。
Basis 以 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5 構建 AI 智能體,協助會計事務所節省最多 30% 的時間。這些智能體亦幫助事務所擴大提供諮詢服務及支持業務增長的能力。
OpenAI 指南説明如何驗證 gpt-oss 推理服務的 API 實作、工具調用與模型表現。Responses API 的 reasoning 項目應以 reasoning_text 傳回原始 CoT;Chat Completions 則建議使用 reasoning 欄位,並在後續請求中一併傳回 CoT。
OpenAI 在 API 平台推出 GPT-5,提供高推理性能和麪向開發者的新控制項,並稱其在真實編碼任務上達到同級最佳表現。
GPT-5 為編碼與設計開啟新的可能性,內容聚焦它如何在這兩個領域帶來新的探索方向。
GPT-5 可協助創意寫作。
GPT-5 用於醫學研究,內容聚焦其在醫學研究中的使用方式。原文沒有提供研究案例、具體方法或研究成果等進一步資訊。
Amgen 使用 GPT-5,內容聚焦該公司如何運用這款模型。原文未提供具體應用場景或部署細節。
Cursor 使用 GPT-5;相關內容聚焦於其使用方式,但未提供具體操作細節。
OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。
推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。
OpenAI Developers 提供使用 LM Studio 在本地設置並運行 gpt-oss-20b 或 gpt-oss-120b 的指南,涵蓋聊天、MCP 伺服器及 LM Studio 本地開發 API。
OpenAI for Government 宣佈與美國總務署(GSA)合作,未來一年向美國聯邦行政部門全體員工提供幾乎免費的 ChatGPT Enterprise。OpenAI 將此安排作為一項新倡議推出。
推薦理由:安排涵蓋整個美國聯邦行政部門員工,並設定為期一年且幾乎免費,呈現這項合作的服務覆蓋範圍與使用期限。
OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款開放權重推理模型。兩款模型依 Apache 2.0 license 及 OpenAI 的 gpt-oss usage policy 提供。
推薦理由:同時列出 gpt-oss-120b 與 gpt-oss-20b,並交代 Apache 2.0 授權及 gpt-oss usage policy,讀者可掌握模型開放使用的基本條件。
OpenAI 今日發佈其迄今能力最強的開放權重模型,稱這是讓先進 AI 在全球更開放、靈活且更容易取得的重要一步。該公司表示,其使命是讓盡可能多人都能使用 AI;AI 的下一個前沿不只關乎能力,也關乎誰能使用它。
OpenAI Developers 示範用 Hugging Face TRL 和 LoRA 微調 openai/gpt-oss-20b,讓模型按指定語言生成鏈式推理。
OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。
推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。
OpenAI 介紹用 Ollama 在本地運行兩款 gpt-oss 模型,支援離線聊天、API 調用及接入 Agents SDK。gpt-oss-20b 建議至少 16GB VRAM 或 unified memory,gpt-oss-120b 至少 60GB;模型預設採用 MXFP4 量化,VRAM 不足時可用 CPU,但速度較慢。
推薦理由:指南比較兩個模型所需的硬件配置,並串起本地聊天、Chat Completions API 與 Agents SDK 接入步驟,便於評估本地部署路徑。
OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款低成本開放權重語言模型,採用 Apache 2.0 授權。它們在推理任務上優於規模相近的開放模型,並具備良好工具使用能力,亦針對消費級硬件高效部署作最佳化。
推薦理由:推理表現、工具使用能力與消費級硬件部署資訊一併呈現,便於從能力和部署兩方面理解兩款開放權重模型的取向。
OpenAI 正依據專家意見改進 ChatGPT,涵蓋艱難時刻支援、休息提醒和生活建議,目標是按用户所需提供協助。休息提醒已推出,艱難時刻支援正在改善,生活建議則仍在完善中。