OpenAI 與 Amazon 宣佈戰略合作,將 Frontier 平台帶至 AWS
OpenAI 與 Amazon 宣佈戰略合作,將 OpenAI 的 Frontier 平台帶至 AWS。合作亦將擴展 AI 基礎設施、客製模型及企業 AI 智能體。
推薦理由:合作將 Frontier 平台帶至 AWS,並涉及基礎設施、客製模型及企業智能體,可由此瞭解雙方合作涵蓋的企業 AI 範圍。
OpenAI 與 Amazon 宣佈戰略合作,將 OpenAI 的 Frontier 平台帶至 AWS。合作亦將擴展 AI 基礎設施、客製模型及企業 AI 智能體。
推薦理由:合作將 Frontier 平台帶至 AWS,並涉及基礎設施、客製模型及企業智能體,可由此瞭解雙方合作涵蓋的企業 AI 範圍。
OpenAI 在 Amazon Bedrock 推出面向 AI 智能體的有狀態執行環境 Stateful Runtime for Agents。該環境為由 OpenAI 驅動的多步驟 AI 工作流程提供持久化編排、記憶與安全執行。
OpenAI 與太平洋西北國家實驗室合作推出 DraftNEPABench,評估 AI 編碼智能體加快聯邦許可審批的能力。該 benchmark 顯示,AI 有望將 NEPA 草案撰寫時間最多縮短 15%,並展示現代化基礎設施審查的潛力。
OpenAI 的 Codex 提示詞指南介紹如何透過 API 使用 gpt-5.3-codex,並配置編碼智能體的提示詞與工具。指南建議一般互動式編碼採用 medium reasoning effort,較難任務可選 high 或 xhigh,並移除要求模型預先提供計劃、前言或執行期間狀態更新的提示。
新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。
Inception Labs 發佈 Mercury 2 推理語言模型,透過擴散模型並行修訂生成回應,主打低延遲推理。官方列出其在 NVIDIA Blackwell GPUs 上達 1,009 tokens/sec,並稱生成速度提升 >5x;價格為 $0.25/1M input tokens、$0.75/1M output tokens。
OpenAI 宣佈 Frontier Alliance Partners,協助企業將 AI 試點項目轉入生產環境,並以安全、可擴展的方式部署智能體。
Manus 推出分步指南,教小企業主在 30 分鐘內使用 Manus 和 Gmail、無需編寫程式碼,構建 AI 客户支援智能體。智能體每天兩次檢查 Gmail 收件箱中的新支援郵件,參考知識庫起草個人化回覆;用户審批後才會發送,亦可批量批准整個支援郵件隊列。
OpenAI 與 Paradigm 推出 EVMbench,評測 AI 智能體偵測、修補及利用高危智能合約漏洞的能力。
Anthropic 在 Claude Platform 推出 Claude Sonnet 4.6,定位為兼顧速度與智能的日常任務模型,智能體搜尋表現提升且 token 消耗較少。
Manus 推出 Manus Agents,讓用户今天起可透過 Telegram 使用 Manus,並向所有訂閲層級開放;Telegram 是首個支援渠道。用户在 Manus 工作區的 Agents 標籤頁掃描 QR code,約一分鐘即可連接,無需命令列、設定檔或 API tokens。
Hugging Face 製作 CUDA kernel 技能,Claude 和 Codex 依此為 diffusers 與 transformers 目標產生可運行的 kernel。
推薦理由:文章拆解如何把 GPU 架構知識、PyTorch 整合範式與基準測試流程封裝成技能,讓編碼智能體產出可構建、可測試的 CUDA kernel 專案。
Manus 的文章以兩組相同提示詞比較 Manus 與 Synthesia,測試顯示 Synthesia 動態較自然,Manus 更能遵循場景細節。企業影片提示要求生成 30 秒影片,Manus 輸出 30 秒,Synthesia 則約 8 秒,兩者的動畫都有瑕疵。文章認為 Synthesia 更適合專業化身影片,Manus 則較適合重視創意自由和多步驟工作流程的用户。
OpenAI 技術人員 Ryan Lopopolo 探討 Harness 工程,聚焦在智能體優先的世界中如何運用 Codex。
Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。
Manus 初學者指南提供多組提示詞,協助非技術用户將 Manus 用作可跨步驟執行任務的 AI 智能體,而非只作聊天工具。提示詞涵蓋日常規劃、生活管理、工作跟進、研究監控、學習與活動策劃。指南建議按實際目標選擇提示詞、替換方括號內容,並讓 Manus 主導多步驟流程。
Manus 團隊以相同提示詞測試並排名12款AI簡報工具,Manus AI以9/10列為最佳整體工具。評分涵蓋內容質素、匯出保真度、演講備註、設計、易用性及價格價值;測試總結指出,速度較快的工具通常內容較淺。Manus披露其產品參與比較,並稱所有工具均按相同標準及測試方法評估。
OpenAI 的 GPT-5 與 Ginkgo Bioworks 的雲端自動化結合成自主實驗室,透過閉環實驗將無細胞蛋白質合成成本降低 40%。
Google 提出 Natively Adaptive Interfaces(NAI)框架,以多模態 AI 工具建立更個人化、具適應性的無障礙應用介面。NAI 主張按情境資訊作出設計決策,並以動態、由智能體驅動的模組取代靜態導覽。Gemini 原型可將即時影片轉為互動音訊描述,讓使用者即時查詢畫面細節。
OpenAI 推出 Frontier,作為建置、部署及管理 AI 智能體的企業平台。平台提供共享上下文、導入、權限及治理功能。
OpenAI 發佈 GPT-5.3-Codex,這款 Codex 原生智能體結合前沿編碼表現與通用推理,支援長週期的現實技術工作。
GPT-5.3-Codex 系統卡將該模型描述為迄今能力最強的智能體編碼模型。它結合 GPT-5.2-Codex 的前沿編碼表現,以及 GPT-5.2 的推理和專業知識能力。
OpenAI 與 Snowflake 達成 $200M 合作,旨在將前沿智能引入企業數據。合作將在 Snowflake 中直接提供 AI 智能體與洞察。
OpenAI 推出 macOS 版 Codex app,定位為 AI 編程與軟件開發的指揮中心,支援多個智能體、平行工作流程及長時間任務。
推薦理由:公告呈現 Codex app 在 macOS 上的工作流定位,重點是以多個智能體、平行流程和長時間任務支援 AI 編程與軟件開發。
Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。
Hugging Face 介紹 upskill 如何以 Claude Opus 4.5 完成 CUDA kernel 任務、從任務軌跡生成 Agent 技能,再評估技能對其他模型的效果。文中一個示例中,unsloth/GLM-4.7-Flash-GGUF:Q4_0 的測試表現由 40% 升至 85%;部分模型使用技能後 token 用量反而增加,文章建議逐一比較。
OpenAI 透過內置防護措施,在 AI 智能體開啟連結時保護用户數據,防止基於 URL 的數據外洩及提示詞注入。
Mistral AI 發佈 Mistral Vibe 2.0,這款由 Devstral 2 模型系列驅動的終端原生編碼智能體新增自訂子智能體、多選澄清、斜線命令技能及可配置工作模式。
推薦理由:Mistral Vibe 2.0 把自訂子智能體、執行前多選澄清和斜線命令技能納入終端編碼流程,具體呈現其工作流控制方式的變化。
TRUSTBANK 與 Recursive 合作,使用 OpenAI 模型打造 Choice AI,透過 AI 智能體為 Furusato Nozei 禮品提供個人化對話式推薦。這項服務旨在簡化用户發掘禮品的流程。
Manus AI 宣佈將全面整合 Agent Skills,並推出把成功工作流程封裝為 Skill 的功能及 /SKILL_NAME 斜線命令。Skills 採用漸進式披露,啟動時載入 metadata(約 100 tokens/Skill),觸發時載入 SKILL.md(<5k tokens),其他資源按需載入。
OpenAI 深入剖析 Codex 智能體循環,説明 Codex CLI 如何透過 Responses API 協調模型、工具、提示詞與效能。
AI 寫作工具擅長快速起草、維持文案一致及改善語法,電郵自動化則處理觸發式序列、個人化與寄送時序,但兩者都難以掌握既有工作脈絡。Manus 作為 AI 智能體,可把先前研究、示範簡報及需求分析帶入跟進郵件草稿;Mail Manus 會觀察使用者的問候、語氣、句式和結尾習慣,逐步貼近其寫作方式。
AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。
Factory 推出 Agent Readiness,按八個技術支柱和五個成熟度級別評估程式碼庫對自主開發的支援程度,並提供優先修復建議。它以 LLM 評估 60+ 項準則,並以前一份報告作為評估基準;在涵蓋低、中、高成熟度級別的 9 個基準倉庫中,評分波動由平均 7%、峯值 14.5% 降至 0.6%,連續六週維持該水平。
Manus 宣佈與 Similarweb 建立官方數據合作,將其網站流量及市場分析數據整合至 Manus,供 AI 智能體在對話中調用。Manus 用户現可使用 Manus 積分查詢最多 12 個月的歷史數據,毋須 Similarweb 訂閲,費用按端點、網域數、國家數及時間跨度計算。
Manus 推出 Meeting Minutes,可把面對面會議、訪談或獨白轉成含要點、與會者和待辦事項的結構化筆記。錄音期間會即時轉錄並識別説話者;筆記亦可作為同一任務的上下文,用於製作簡報、網站或社交媒體素材,並邀請他人協作。該功能現已向所有 Manus 用户開放,不適用於線上會議;錄音免費,分析及生成筆記會消耗積分。
Netomi 使用 GPT-4.1 和 GPT-5.2 擴展企業 AI 智能體系統,結合並發處理、治理與多步推理,以建立可靠的生產工作流程。
Manus 推出 Slack 連接器,讓用户以自然語言讀取 Slack 頻道、提取洞察和待辦事項,並把結果分享到指定頻道。連接器現已向所有 Manus 用户開放,使用應用內 AI 功能需要付費 Slack 方案。
Manus 宣佈即將加入 Meta,並表示會繼續透過 app 和網站提供產品及訂閲服務,公司亦會繼續在新加坡營運。按 12 月初統計,自上線以來 Manus 已處理超過 147 萬億個 token,並建立超過 8000 萬台虛擬電腦。首席執行官肖弘表示,與 Meta 攜手可讓 Manus 在不改變運作方式和決策機制的前提下,在更強大、更可持續的基礎上發展。
推薦理由:公告交代 Manus 加入 Meta 後產品服務及新加坡營運安排,並列出上線以來的使用規模,呈現組織變動與現有服務延續的關係。
ServiceNow AI 發佈 AprielGuard,一款 8B 參數的安全防護模型,可分類 16 類安全風險並檢測多種對抗攻擊。模型支援單獨提示詞、多輪對話及包含工具呼叫、推理軌跡和記憶的智能體工作流,並提供可輸出結構化解釋的推理模式和僅分類的快速模式。