Consensus 以 GPT-5 和 Responses API 加速研究
Consensus 使用 GPT-5 與 OpenAI 的 Responses API,驅動多智能體研究助理,以加速研究。該助理可在數分鐘內閲讀、分析並綜合證據,協助超過 8 million 名研究人員加快科學發現。
Consensus 使用 GPT-5 與 OpenAI 的 Responses API,驅動多智能體研究助理,以加速研究。該助理可在數分鐘內閲讀、分析並綜合證據,協助超過 8 million 名研究人員加快科學發現。
Meta 與 Hugging Face 合作推出 OpenEnv Hub,供開發者建立、分享和探索可用於訓練與部署的智能體環境。OpenEnv 以沙盒封裝任務所需工具、API、憑證及執行上下文,並提供清晰語義與隔離控制;團隊同時發布 OpenEnv 0.1 Spec(RFC)徵求社羣意見。
推薦理由:OpenEnv 將智能體任務所需的工具、API、憑證與執行上下文封裝成可分享環境,並銜接訓練和部署,呈現環境規格化的實際用途。
上下文策略聚焦於如何讓 Codex 式編碼智能體在 Cursor 中協作。討論亦涉及智能體與上下文窗口。
Manus 推出 Manus 1.5,提供具備最新架構完整功能的 Manus-1.5,以及以成本效益為優化方向的精簡版 Manus-1.5-Lite,涵蓋研究、數據分析、網頁開發和簡報製作等任務。
OpenAI 發佈 AgentKit、擴展的評測能力,以及面向智能體的強化微調(RFT)。這些工具旨在協助開發者更快從原型走向生產。
推薦理由:AgentKit、擴展評測能力與智能體強化微調同屬加快開發者從原型走向生產的工具更新,呈現 OpenAI 此次發佈的整體方向。
OpenAI 的 ChatKit 進階範例倉庫提供四個情境式示範,均以 FastAPI 後端配合 Vite + React 前端,並連接 ChatKit Python SDK 與 ChatKit.js。範例涵蓋虛擬貓照護、航空客户支援、新聞導覽及地鐵路線規劃,展示服務端和客户端工具、互動 widgets、附件與語音聽寫等功能。
OpenAI 建立系統,快速擷取合約資料並轉化為可搜尋資料。系統縮短了處理時間,也讓團隊更容易取得所需細節。
OpenAI 的 Agentic Commerce Protocol(ACP)是一項開放標準,作為商家與 ChatGPT 用户之間的連接層。它讓 ChatGPT 能讀取結構化商品目錄資料、理解商家庫存,並在合適情境中呈現相關商品。
OpenAI 表示正透過 ChatGPT 邁出智能體商務的第一步,並推出 Instant Checkout 與 Agentic Commerce Protocol。這些新方式讓人、AI 智能體與企業共同購物。
Hugging Face 的 Swift 函式庫 swift-transformers 發佈 1.0,標誌套件進入穩定階段,並為後續功能迭代奠定基礎。Tokenizers 和 Hub 現已成為頂層模組,套件亦採用支援有狀態模型的 Modern Core ML API,並完整支援 Swift 6。團隊表示,後續將聚焦 MLX 與智能體應用。
Hugging Face 推出 Gaia2 智能體基準及 Meta Agents Research Environments(ARE)框架,用於在更複雜、接近真實情境的環境中執行、除錯和評估智能體。
推薦理由:Gaia2 將智能體評測從唯讀檢索擴展至含模糊指令、時間要求和環境故障的互動任務,ARE 記錄執行 traces,便於分析智能體在複雜情境中的失誤。
DeepSeek 將 API 中的 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1-Terminus,分別對應非思考模式與思考模式。更新維持模型原有能力,減少中英文混雜及偶發異常字元。Code Agent 和 Search Agent 的效能亦獲進一步優化。
OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。
推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1,兩者分別對應非思考模式和思考模式。
Basis 以 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5 構建 AI 智能體,協助會計事務所節省最多 30% 的時間。這些智能體亦幫助事務所擴大提供諮詢服務及支持業務增長的能力。
OpenAI 介紹用 Ollama 在本地運行兩款 gpt-oss 模型,支援離線聊天、API 調用及接入 Agents SDK。gpt-oss-20b 建議至少 16GB VRAM 或 unified memory,gpt-oss-120b 至少 60GB;模型預設採用 MXFP4 量化,VRAM 不足時可用 CPU,但速度較慢。
推薦理由:指南比較兩個模型所需的硬件配置,並串起本地聊天、Chat Completions API 與 Agents SDK 接入步驟,便於評估本地部署路徑。
OpenAI 的 Function calling 指南説明,如何透過 API 讓模型呼叫應用程式提供的函數與自訂工具,以存取外部資料或執行操作。內容涵蓋 Responses API 與 Chat Completions 的工具呼叫流程、JSON Schema 定義、strict mode、工具選擇和並行呼叫。
文章示範如何以 Gradio 在 Python 中實作 MCP 伺服器,並建立可瀏覽服裝網站、呼叫 IDM-VTON 虛擬試穿的 AI 購物助手。Gradio 會把應用程式的 API endpoint 自動轉為具名稱、描述及輸入 schema 的 MCP 工具,並支援即時進度通知和自動檔案上傳。
推薦理由:示例將 Gradio MCP 伺服器、Playwright 網頁瀏覽與 IDM-VTON 虛擬試穿串成工作流程,並列出 VS Code 設定步驟。
Manus 推出 Wide Research,讓用户處理需要蒐集數百個項目資料的複雜大型任務。它以通用 Manus 實例作為子智能體,構成系統級並行處理機制及智能體間協作協議。目前正式向 Pro 用户推出,並計劃逐步開放予 Plus 和 Basic 層級用户。
Mistral AI 發佈 Codestral 25.08,並推出整合程式碼補全、語意檢索、Devstral 智能體工作流及 Mistral Code IDE 外掛的企業編碼技術棧。
推薦理由:文章把 Codestral 25.08、程式碼檢索、Devstral 智能體工作流與 IDE 管理整合為企業方案,並交代部署選項及安全治理設計。
Model ML 正協助金融機構以 AI 從頭重建業務。Model ML 行政總裁 Chaz Englander 在 Executive Function 系列中,談及 AI 原生基礎設施與自主智能體如何改變金融服務工作流程。
OpenAI 示範智能體如何透過工具呼叫完成任務。內容涉及 Responses API、function calling 和 Agents SDK,聚焦智能體工具呼叫。
OpenAI 示範 AI 智能體如何調用內置工具完成任務。內容涵蓋 Responses API、function calling、Agents SDK、agentic 與 tool calling。
OpenAI Agents SDK 快速入門示範如何建立並執行 Agent、加入工具,並以 handoffs 將問題交由不同專家 Agent 處理。指南亦介紹多輪對話可透過 result.to_input_list()、session=... 或 previous_response_id / conversation_id 延續,並附上 SDK 安裝和 API key 設定步驟。
OpenAI 語音應用指南介紹三種語音智能體架構:GPT-Live 搭配獨立後端、Realtime API 在單一會話中處理語音、推理與工具使用,以及可逐階段檢視或替換元件的串接式語音管線。指南列出任務與工具結果、對話時序、語音與語言、會話可靠性等評估面向,並建議以 Crawl、Walk、Run 逐步增加測試複雜度。
OpenAI 指南按速度、成本、準確度及任務複雜度,説明如何選擇推理模型與 GPT 模型。指南建議由推理模型負責複雜規劃與決策、GPT 模型執行明確任務;提示詞保持簡潔直接,先試 zero-shot,必要時再加入 few-shot 範例。
OpenAI 的 Python SDK 指南介紹多智能體編排的兩種方式,即由 LLM 規劃和決策,或由程式碼控制流程,兩者也可混合使用。SDK 常見模式包括由管理者 Agent 透過 `Agent.as_tool()` 調用專家,或由分流 Agent 透過 handoffs 將對話交給專家接手當前回合。
OpenAI Developers 的 Agents SDK 頁面標題為「解鎖智能體能力」,但目前可見正文只有要求訪客確認真人身份的驗證提示。頁面另提示 vimeo.com 需要先檢查連線安全,沒有提供 SDK 的功能或技術細節。
OpenAI Developers 提供基於 Responses API 的 NextJS starter app,示範多輪對話、串流回應和工具調用。介面可配置 web search、file search、code interpreter 和公開 MCP server,亦示範以 OAuth 整合 Google Calendar 與 Gmail。
OpenAI 公開了一個基於 Responses API 的客服 AI 智能體人機協作示例程式庫,設有客户與人工客服兩種聊天介面。示例使用內置 file search 工具提供知識庫檢索和建議回覆,敏感操作由人工確認,非敏感操作可自動執行。示例中的函數目前只是佔位實現,不會實際修改資料;項目亦未達生產環境使用要求,用於生產環境前需補充輸入防護措施、用户身份驗證等安全措施。
OpenAI Developers 的「Realtime agent demo」頁面只顯示要求確認使用者為真人的驗證提示,未載有示範內容。頁面並提示 vimeo.com 需先檢查連線安全,沒有提供模型名稱或其他技術細節。
OpenAI 的 Computer Use API 指南説明,模型可透過瀏覽器或桌面介面填表、測試使用者流程或完成應用程式任務,應用程式負責提供環境並執行模型要求。
OpenAI Developers 提供結合 Realtime API 與 Twilio 電話通話能力的 starter app,用於構建 AI 電話助手。示例以 NextJS 前端和 Express WebSocket 後端串接 Twilio 雙向通話串流與 Realtime API,後端亦向前端轉發訊息。
OpenAI 的語音智能體指南比較 GPT-Live、Realtime API 與分階段語音管線,説明三種架構各自適用的場景。指南涵蓋 GPT-Live 的 Client delegation 和 Responses delegation,以及可逐階段檢視或轉換文字的管線設計。
OpenAI 的內建工具指南整理了可用工具,以及在 Responses API、Agents API 和 Agents SDK 中的接入方式。所列工具包括網頁搜尋、檔案搜尋、函數呼叫、遠端 MCP、Skills、Shell、電腦操作、圖像生成、tool search 和 Programmatic Tool Calling。
Manus 團隊分享構建 Manus 的 AI 智能體上下文工程經驗,提出管理上下文、工具選擇與記憶的設計原則。文章建議保持提示詞前綴穩定、避免在迭代中動態增刪工具,並把檔案系統作為可恢復的外部記憶;另指出應在上下文中保留失敗記錄,並持續重述待辦目標。文中提到 Manus 平均輸入與輸出 token 比例約為 100:1,典型任務平均約有 50 次工具呼叫。
Mistral AI 為 Le Chat 推出 Deep Research、語音、多語言推理、Projects 和圖片編輯等新功能。Deep Research(Preview)可搜尋可信來源並生成附參考資料的結構化報告,語音模式採用 Voxtral,多語言推理由 Magistral 驅動,圖片編輯則與 Black Forest Labs 合作。
推薦理由:Le Chat 把研究、語音、多語言推理、Projects 與圖片編輯納入同一產品,呈現其如何覆蓋資訊整理、語音互動和圖像修改等不同任務。
OpenAI 推出 ChatGPT agent;它能思考並採取行動,在使用者指引下運用工具完成研究、預訂及簡報等任務。
推薦理由:原文將 ChatGPT agent 的定位連到工具操作與使用者指引,並以研究、預訂和簡報列出可處理的任務範圍。
OpenAI Developers 的 Building agents 學習專題介紹構建 AI 智能體的核心概念與實作流程,涵蓋模型選擇、工具使用、編排和最佳實踐。
OpenAI Developers 提供一套面向開發者的 AI 應用開發學習路線,按四階段涵蓋基礎概念、應用開發、測試與評估,以及規模化和維護。內容介紹如何透過 Responses API 或 Agents SDK 建置智能體,並説明 RAG 用於引入知識、微調用於調整模型行為,以及用 evals 和 guardrails 測試與約束應用。