研究提出開放世界評測框架,並以 CRUX 測試 AI 智能體發布 iOS App
Sayash Kapoor 等研究者提出開放世界評測框架,並介紹由 17 位研究者參與的 CRUX 協作項目,計劃定期評估前沿 AI 能力。首項實驗使用 OpenClaw 與 Claude Opus 4.6,AI 智能體經兩次錯誤(其中一次需人手介入)後,成功將簡單 iOS App 上架 App Store,總成本約 $1,000。
Sayash Kapoor 等研究者提出開放世界評測框架,並介紹由 17 位研究者參與的 CRUX 協作項目,計劃定期評估前沿 AI 能力。首項實驗使用 OpenClaw 與 Claude Opus 4.6,AI 智能體經兩次錯誤(其中一次需人手介入)後,成功將簡單 iOS App 上架 App Store,總成本約 $1,000。
OpenAI 更新 macOS 和 Windows 版 Codex app,加入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件。這些功能旨在加快開發者工作流程。
推薦理由:這組更新同時納入電腦操作、應用程式內瀏覽、圖像生成、記憶及插件,呈現 Codex app 面向開發者工作流程的擴展範圍。
OpenAI 推出 GPT-Rosalind,這是一款旨在加速藥物發現、基因組分析、蛋白質推理及科學研究工作流程的前沿推理模型。
Codex app 新更新涵蓋開發者跨工具、應用程式、自動化及更多開發工作流程的使用情境。
OpenAI 宣佈領先安全公司及企業加入 Trusted Access for Cyber,以加強全球網絡防禦。公告提及 GPT-5.4-Cyber 和 $10M API grants,作為加強網絡防禦的資源。
Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。
推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。
OpenAI 更新 Agents SDK,加入原生沙盒執行與模型原生 harness。這些更新旨在協助開發者構建可跨文件和工具運作的安全、長時間運行智能體。
推薦理由:更新把原生沙盒執行和模型原生 harness 納入 Agents SDK,呈現其對安全、長時間運行智能體跨文件與工具工作的支持。
HCompany 推出免費 Chrome 擴充功能 HoloTab,讓用户無需設定或技術技能,即可由 AI 智能體在瀏覽器中執行網站任務。用户可錄製操作並沿途講述目的,生成 routine 後再重跑或排程執行。HoloTab 已開放使用:https://chromewebstore.google.com/detail/holotab/hlaoiikljjgcjdhkakedfngifaopbcop
推薦理由:HoloTab把網頁操作交給瀏覽器內的智能體,並以錄製操作、補充講述來生成可重跑或排程的流程,呈現重複網頁任務的自動化方式。
OpenAI 擴大 Trusted Access for Cyber 計劃,向經審核的防禦者引入 GPT-5.4-Cyber。OpenAI 同時在 AI 網絡安全能力持續進展之際加強防護措施。
ARC Prize Foundation 公開 ARC-AGI-3 人類測試數據,並將每關評分基線由第二佳參與者成績改為中位數。研究納入 458 名參與者,公開數據集收錄 25 個公開環境的 342 段逐步回放。單關分數上限由 100% 提高至 115%,人類和 AI 的分數因此平均增加 +0.5pp。
Google Research 公開 Vantage 研究實驗,透過生成式 AI 模擬多人對話,評估高中及大專院校學生的未來所需技能。
Google DeepMind 發佈 Gemini Robotics-ER 1.6,提升機械人的空間與多視角推理能力,並新增儀表讀數能力。模型在指點、計數、任務成功檢測等方面較 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有所提升,並透過 Gemini API 和 Google AI Studio 向開發者提供。
Cloudflare 將 OpenAI 的 GPT-5.4 和 Codex 帶入 Agent Cloud,讓企業可構建、部署及擴展面向實際任務的 AI 智能體。相關方案強調速度與安全性,支援企業推動智能體工作流程。
ChatGPT 可讓使用者透過清晰提示詞創作及完善圖像,並在數分鐘內生成高質素視覺作品。使用者亦可反覆調整設計,逐步優化圖像。
臨牀醫護人員使用 ChatGPT 支援診斷、文件記錄及患者護理。相關 AI 工具安全且符合 HIPAA 規範。
透過自訂指示和記憶,使用者可個人化 ChatGPT,讓回覆更相關、保持一致,並更貼合個人需求與偏好。
ChatGPT 可結合搜尋與 deep research 協助使用者進行研究,查找最新資訊、分析來源,並生成結構化洞見。
ChatGPT 專案可用於整理對話、檔案與指示,並管理持續進行的工作。亦可協助提升協作效率。
ChatGPT 可用於發想點子、整理思路,並將粗略概念轉化為有結構、可執行的計劃,涵蓋從初步構想到行動規劃的腦力激盪流程。
ChatGPT 可協助管理者準備對話、撰寫清晰的回饋、保持工作有序,並改善團隊效能。
ChatGPT 可協助起草、修訂和潤飾內容,讓文字具備清晰的結構、語氣與意圖。
銷售團隊可學習運用 ChatGPT 的實用工作流程,應對多個銷售環節。內容涵蓋客户帳户研究、會議準備、外聯、銷售管道檢視及銷售執行。
OpenAI 提供人工智能入門指南,説明 AI 是甚麼、如何運作,以及 ChatGPT 如何運用大語言模型。內容面向初學者,以清晰易懂的方式介紹人工智能。
OpenAI 透過 ChatGPT、Codex 和 APIs,將 AI 帶入工作、開發及日常任務等實際應用場景。
ChatGPT 可協助研究者蒐集來源、分析資訊,並整理出結構化且附有引文的見解,涵蓋由資料蒐集到研究成果整理。
使用者可建立及使用 ChatGPT 技能,構建可重用工作流程、自動化重複任務,並確保輸出一致且高質素。
OpenAI 提供使用 ChatGPT 等 AI 工具的建議,涵蓋安全、準確與透明度最佳實踐,協助用户以負責任的方式使用 AI。
OpenAI 的 ChatGPT 提示詞基礎內容説明如何撰寫清晰、有效的提示詞,以取得更好、更實用的回覆。
OpenAI 分享面向財務團隊的實用 ChatGPT 工作流程,涵蓋財務分析、報告、規劃及支援決策的溝通。內容聚焦 ChatGPT 在這些工作場景中的實際應用。
OpenAI 為金融服務機構提供 AI 資源,包括提示詞套件、GPTs、指南及工具,協助機構安全部署並擴展 AI。
市場營銷團隊運用 ChatGPT 的實用 AI 工作流程,規劃營銷活動、創作內容、分析成效,並將洞察轉化為行動。
客户成功團隊使用 ChatGPT 管理客户帳户、改善溝通並減少客户流失。ChatGPT 亦可協助推動採用與續約。
ChatGPT 可用於探索資料集、生成洞見、建立視覺化呈現,並將分析發現轉化為可執行的決策。
OpenAI 提供在 ChatGPT 中處理檔案的實用方法,涵蓋查找資訊、整理與轉換文件,以及在工作流程中使用文件。
營運團隊運用 ChatGPT 精簡工作流程、改善團隊協調、推動作業流程標準化,並加快工作執行。
CyberAgent 使用 ChatGPT Enterprise 和 Codex,在廣告、媒體及遊戲業務中安全擴大 AI 應用,提升品質並加快決策。
Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。
推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。
Sentence Transformers v5.4 的同一 API 現可編碼並比較文字、圖像、音訊和影片,文章示範其多模態嵌入與 reranker 用法。嵌入模型將不同模態映射至共享嵌入空間;預訓練多模態 reranker 目前主要處理文字與圖像配對。示例涵蓋跨模態檢索、混合模態文件重排及先檢索再重排流程,並列出輸入格式、支援模型和安裝依賴。
推薦理由:文章展示 Sentence Transformers v5.4 的跨模態檢索與 reranker 重排流程,並整理支援模型和輸入格式,提供實作參考。
Manus 的指南提出品牌攝影 AI 圖像提示詞的四層結構,依次描述主體與服裝、場景、相機與膠片類型,以及光線。指南提供廣角、三分之四、側面輪廓、特寫、背面角度和雙人鏡頭的可複製範例,示範中多次使用 Kodak Portra 400。它建議在各提示詞中固定模特描述、相機、膠片和光線設定,以維持系列圖片的一致性。
OpenAI 勾勒企業 AI 的下一階段,並指出各行業採用速度正在加快。新階段涉及 Frontier、ChatGPT Enterprise、Codex,以及全公司 AI 智能體。