OpenAI Developers plugin 為 ChatGPT、Codex、Claude Code 和 Cursor 提供 OpenAI API 開發支援
OpenAI Developers plugin 為 ChatGPT 和 Codex 提供 OpenAI Platform 接入、API 設定指引及智能體開發支援。
OpenAI Developers plugin 為 ChatGPT 和 Codex 提供 OpenAI Platform 接入、API 設定指引及智能體開發支援。
Manus Blog 以同一份個人理財網站提示詞實測 Replit、Manus AI、Lovable、Vercel v0、Base44 和 Hostinger Horizons,並比較各工具的生成結果與使用體驗。
Manus 介紹 Cloud Computer,讓 Bot、Python 腳本及軟體在專屬雲端機器上 24/7 運行。與會話結束即消失的標準沙盒不同,它會持續運作並保留檔案及已安裝工具,適合 24/7 Bot、定時任務、持久資料庫及自託管開源工具。每項任務仍從臨時沙盒開始,Manus 再按任務需要決定是否使用 Cloud Computer。
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
OpenAI 的 GPT models、Codex 與 Managed Agents 現已在 AWS 提供。OpenAI 表示,企業可在 AWS 環境建構安全 AI。
推薦理由:這項 AWS 上線交代了 OpenAI GPT models、Codex 與 Managed Agents 的可用範圍,也説明企業可在 AWS 環境建構安全 AI 的使用場景。
Mistral AI 開放企業 AI 編排層 Workflows 公開預覽,讓開發者以 Python 編寫流程,並可發佈至 Le Chat 供組織成員觸發。Workflows 提供持久執行、Studio 逐步追蹤及人工審批暫停與恢復,並支援將 workers 和資料處理部署在企業自有環境。
推薦理由:Workflows 將持久執行、Studio 追蹤與人工審批整合,並支援 workers 在企業自有環境運行,呈現企業 AI 流程走向生產的部署設計。
Choco 使用 OpenAI APIs 和 AI 智能體簡化食品分銷流程,提升生產力並促進業務增長。這則客户案例呈現 AI 在實際業務中的應用。
深度求索(DeepSeek)發佈 DeepSeek-V4,Pro、Flash 系列各有 instruct 與 base 版本,四款 checkpoint 均支援 1M-token 上下文。
推薦理由:文章把 KV cache 成本、混合注意力設計與智能體工作流串連起來,並以基準數據呈現長上下文能力在工具任務中的表現。
Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。
推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。
Factory 的 Automated QA 技能由 Droid 在每次推送時按真實用戶方式測試應用程式,並在 PR 留下附有測試證據的結構化報告。團隊可將 CI 設為可選檢查,或在 Droid 工作階段執行 `/qa` 本機測試;`/install-qa` 會按專案設定生成 QA 技能。Automated QA 現已提供予所有 Factory 方案。
OpenAI 提供 ChatGPT 工作區智能體的建立及使用指南,可用於自動化可重複工作流程、連接工具並簡化團隊營運。
OpenAI 在 ChatGPT 推出 Workspace agents,這些由 Codex 驅動的智能體可在雲端自動化複雜工作流程。它們亦可協助團隊安全地透過不同工具擴展工作。
Google DeepMind 宣佈與五家全球企業顧問公司合作,協助各行業大規模採用前沿 AI,推進 AI 驅動的企業轉型。合作方包括 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey,工作聚焦金融、製造、零售、媒體與娛樂等行業,涵蓋行業專屬 AI 能力開發及包括 Gemini 系列在內的前沿模型早期使用。
OpenAI 的 API 部署清單建議以 Responses API 為起點,並按代表性任務比較任務成功率、延遲、token 用量及每項成功任務成本。清單涵蓋 reasoning.effort、工具調用、多智能體、快取與背景任務等配置,並説明 safety_identifier、misalignment 違規及 429/503 錯誤處理。
Sayash Kapoor 等研究者提出開放世界評測框架,並介紹由 17 位研究者參與的 CRUX 協作項目,計劃定期評估前沿 AI 能力。首項實驗使用 OpenClaw 與 Claude Opus 4.6,AI 智能體經兩次錯誤(其中一次需人手介入)後,成功將簡單 iOS App 上架 App Store,總成本約 $1,000。
OpenAI 更新 Agents SDK,加入原生沙盒執行與模型原生 harness。這些更新旨在協助開發者構建可跨文件和工具運作的安全、長時間運行智能體。
推薦理由:更新把原生沙盒執行和模型原生 harness 納入 Agents SDK,呈現其對安全、長時間運行智能體跨文件與工具工作的支持。
HCompany 推出免費 Chrome 擴充功能 HoloTab,讓用户無需設定或技術技能,即可由 AI 智能體在瀏覽器中執行網站任務。用户可錄製操作並沿途講述目的,生成 routine 後再重跑或排程執行。HoloTab 已開放使用:https://chromewebstore.google.com/detail/holotab/hlaoiikljjgcjdhkakedfngifaopbcop
推薦理由:HoloTab把網頁操作交給瀏覽器內的智能體,並以錄製操作、補充講述來生成可重跑或排程的流程,呈現重複網頁任務的自動化方式。
Cloudflare 將 OpenAI 的 GPT-5.4 和 Codex 帶入 Agent Cloud,讓企業可構建、部署及擴展面向實際任務的 AI 智能體。相關方案強調速度與安全性,支援企業推動智能體工作流程。
OpenAI 勾勒企業 AI 的下一階段,並指出各行業採用速度正在加快。新階段涉及 Frontier、ChatGPT Enterprise、Codex,以及全公司 AI 智能體。
文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。
Manus 推出 Slack 整合,提供智能體私訊、頻道內標記 @manus,以及 Slack 連接器三種工作方式。智能體私訊可延續過往對話記憶;頻道內標記只處理當前話題且不具持久記憶,連接器則可代讀和發送 Slack 訊息。智能體預設不能讀取其他頻道,須連接器已連接並將 Manus 加入指定頻道;Slack 應用內 AI 集成功能需使用付費 Slack 套餐。
FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。
Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。
推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。
OpenAI 研究人員測試對齊中訓練在類似 o4-mini 的模型上能否泛化;模型經過推理後訓練後,這種訓練效果未能穩定延伸至較貼近現實的聊天及智能體評測。他們分別以 230k 份文件(約 340M tokens)進行對齊或失準中訓練,並與不加額外中訓練的基線比較;接近訓練分佈的問答評測呈現預期排序。聊天評測中,兩種中訓練結果大多相近;智能體評測未能明確區分三組模型,整體分數沒有顯著差異。
Hamel Husain 認為,LLM API 雖讓團隊可自行整合 AI,評測、實驗設計和生產監測仍需要數據科學方法。文中列出五類評測陷阱,包括套用通用指標、未驗證 LLM 評審、測試集設計不當、數據及標籤質素欠佳,以及過度自動化。作者建議檢視 traces、以人工標註驗證評審,並根據真實生產數據設計測試集,讓領域專家參與標註。
Google Research 宣佈 Vibe Coding XR,結合 Gemini 與 XR Blocks,將自然語言描述轉成具物理感知能力的 Android XR 應用,最快可在 60 秒內生成。
推薦理由:文章展示如何以 XR Blocks 架構、範例模板和專用系統提示詞約束 Gemini,令自然語言生成的 XR 原型遵循既有 API 與互動設計規範。
ARC Prize 發佈 ARC-AGI-3,這是 ARC-AGI 系列首個完全互動式基準,包含數百個互動環境和數千個遊戲式關卡。環境沒有指示、規則或明示目標,AI 智能體須自行探索並將所學帶到難度逐步提高的關卡。ARC Prize 2026 現已開放參賽,獎金超過 $2 million;人類得分為 100%,前沿 AI 得分為 0.51%。
ChatGPT 推出由 Agentic Commerce Protocol 驅動的更豐富、具視覺沉浸感購物體驗。該體驗支援商品探索、並排比較及商户整合。
Manus 推出 Manus Connectors 的 Instagram Creator Marketplace 早期 Beta,將 Meta 官方創作者發掘工具接入 Manus 工作流程。連接器可搜尋和篩選超過 200 萬名創作者,並提供 Meta 認證的一方受眾與績效洞察,亦可把創作者發掘及外聯電郵草擬整合至自動化流程。功能目前在所有 Manus 市場提供,但不包括歐盟國家。
OpenAI 發佈 GPT-5.4 mini 和 nano,兩者是 GPT-5.4 的較小、更快速版本。它們針對編碼、工具使用、多模態推理,以及高用量 API 和子智能體工作負載作最佳化。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Manus 升級 Google Workspace 連接器,讓它可在 Docs、Sheets 和 Slides 中執行精細編輯與結構操作。升級使用 Google Workspace CLI,該開源工具由 Google Workspace 團隊在 GitHub 發佈,但並非 Google 官方支持的產品。新功能已向所有 Manus 用户開放,無需安裝或啟用,且不另收費;既有工作流維持不變。
Manus 推出桌面應用程式核心功能「我的電腦」,讓雲端智能體透過終端命令讀取、分析和編輯本機檔案,並啟動及控制本機應用程式。用户可新增並授權本機資料夾;執行每項命令前須明確批准,亦可選擇「始終允許」或「僅允許一次」。該功能現已向 macOS 和 Windows 用户開放。
推薦理由:Manus 將雲端智能體延伸至本機檔案與應用程式,並透過命令授權讓自動化能力與用户對本機操作的控制並存。
ChatGPT 在智能體工作流程中,透過限制高風險操作及保護敏感資料,防範提示詞注入與社交工程攻擊。這套防護設計著重約束風險操作,並保障工作流程中的敏感資料。
Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。
推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。
OpenAI 的 Codex Security 現已進入研究預覽,是一款 AI 應用程式安全智能體。它會分析專案脈絡,以更高信心、較少雜訊偵測、驗證並修補複雜漏洞。
Sarvam AI 開源 Sarvam 30B 和 Sarvam 105B 兩款從零訓練的推理模型,並提供 API、權重下載及本地推理範例。兩者採用 MoE Transformer 架構,分別以 16T 和 12T tokens 預訓練,並在印度使用 IndiaAI Mission 提供的算力訓練。
Balyasny Asset Management 結合嚴謹的模型評估、全面運用 OpenAI 平台及智能體工作流程,重塑投資研究。
Manus 以相同的 Solace Studio 提示詞測試 7 個 AI 應用程式建構平台,並在文中將自家工具列為整體首選。測試中,Manus 從單一提示詞生成包含預約日曆、Stripe 付款及管理員面板的功能原型;Replit 也嘗試生成完整堆疊,但需具備一定技術經驗以作驗證和除錯。文章指出,多數其他平台先生成視覺介面,部分後端功能需要另行設定或手動構建。