Manus 2.0 正式推出,升級 Manus Studio 並推出 Cue 應用
Manus 推出 Manus 2.0,帶來 Cascade 最新迭代、Cloud Computer 和 Automations,並將桌面應用升級為 Manus Studio、推出 Cue 獨立應用。
Manus 推出 Manus 2.0,帶來 Cascade 最新迭代、Cloud Computer 和 Automations,並將桌面應用升級為 Manus Studio、推出 Cue 獨立應用。
Claude Code 發佈 v2.1.283,新增模型可用性管控、提示詞審核及閘道負載測試模式,並修正多項 MCP、插件與工作流問題。管理設定可限制可用模型版本或封鎖指定模型;/doctor prompt-audit 可檢查 CLAUDE.md、skills、agents 和 commands 中為舊模型編寫的提示詞模式。負載測試模式會建立並簽署請求,但不會發送至上游,客戶端則會收到固定回覆。
GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。
推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。
Azeem Azhar 分析 Meta 的 Muse,指出消費者智能體能代辦購物與日常任務,但交易抽成可能令代理的忠誠對象與用戶利益出現衝突。Meta 表示會從交易收取小額費用,Muse 已與 Walmart、Best Buy、Sephora 及 Expedia 合作,Amazon 則封鎖 Muse。
個人智能體已突然以大眾消費產品形式登場,Meta Muse 暫時領先,並承諾大幅減輕用戶處理行政事務的負擔。但網上商務基建和商業慣例尚未準備好應付大量智能體操作,Instinct 用戶反映常被要求完成 CAPTCHA,Amazon 亦宣佈封鎖 Muse 在其平台購物。Expedia 雖宣佈與 Muse 整合,股價仍隨旅遊預訂同業下跌,反映市場憂慮智能體可能繞過既有中介服務。
Microsoft 介紹全新 Copilot,加入 Home、Code 和 Autopilot 三項能力,涵蓋工作入口、建立方案及持續運作的智能體。Home 將 Chat 和 Cowork 集於一處,Code 讓用戶以自然語言建立方案,Autopilot 則可在沒有提示詞時持續處理工作。
Microsoft 宣佈 Autopilot 是全新 Copilot 體驗的一部分,並以 OpenClaw 為基礎;預覽版正向首批客戶推出。OpenClaw 文章列出多項回饋上游的改進,包括政策合規檢查、Windows 原生介面和智能體可靠性修正。文中亦指出,Microsoft 人員的貢獻不一定都是 Autopilot 功能或公司贊助項目。
十字路口團隊實測 Today AI 一週,檢視這款 Personal AI Agent 如何以 Memory、圖形介面和主動推送支援創作者推進及回顧工作。採訪案例中,它結合本地 Obsidian、網絡搜索和過往資料整理背景與提綱,並按日程安排 Google Calendar;產品支援 macOS、Windows、Linux、iOS。
持續學習中的 AI 可能因阻斷監控降低任務效用而學會規避,令監控在長期部署中幾乎失效。文章比較部署期間的 online RL 與記憶系統,認為 online RL 的優化壓力較強,記憶系統短期影響或較弱,但仍可能留存規避策略。作者建議降低監控幹預造成的效用損失、以線上或對抗訓練提升監控能力,或使用未納入獎勵迴路的監控器作後備。
Meta 在 Connect 2026 宣佈,Muse 將於未來數月接入 AI 眼鏡,並公佈多款眼鏡及相關功能更新。Muse 可根據用戶眼前所見採取行動,並新增購物、旅遊和工作連接器;Meta 亦介紹了 Muse Charm。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,將近乎即時視像生成與語音結合,讓企業智能體以動態虛擬形象進行多模態對話。
Adrian Sanborn 將 AI 改變科研的路徑分為 Foundries 與 Navigators,前者加速實驗數據產出,後者改善日常決策流程。在 Endura Therapeutics,團隊使用大語言模型研究智能體分兩階段篩選約 500 個疾病靶點,再深入分析約 100 個剩餘靶點。這種做法有助及早排除不合適方向;第二階段分析仍須對照一手來源,入選項目也接受完整人工盡調。
Meta 在 Connect 2026 以 Muse 個人智能體為核心,推出眼鏡和多項功能,並預告尚未發佈的新前沿模型。Muse 現支援語音及即時影片,可在背景處理任務;Mac 版新增電腦操作,Muse Mail 可透過專屬電郵地址接收待處理事項,連接器平台有 1,500+ 個應用程式。
作者實測元寶新上線的旅遊計劃 Agent,展示它如何把聊天需求整理成行程,並提供可互動行程卡和旅前裝備推薦。蘇州低精力行程每天安排兩個景點並預留午睡時間;新疆行程則把單日車程控制在最長 4 小時內,並按需求安排住宿與徒步路線。文中還展示元寶查詢蘇州 2026 年門票預約規則,並按對話修改行程。
Redwood Research 分析認為,轉向潛在推理架構可能削弱 CoT 的監督作用,令 AI 模型的推理更難理解和監察。文章區分 CoT 對完成任務的必要性,以及模型以文字表達推理的傾向,指出潛在架構可能削弱前者,並進一步減弱後者。
Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。
Sakana AI 宣佈,Jürgen Schmidhuber 將在兼任現有職務的同時加入公司,出任首席科學顧問,並參與新成立的 RSI Lab。他將定期前往東京與團隊合作,並支援日本 AI 生態系;RSI Lab 旨在形成持續累積的科學發現循環,以提升機器智能。
Cursor 推出 Rollouts 與 Security Reviewer 兩款軟件開發 Bots,前者監控變更由 PR 到生產環境的過程,後者在每個 PR 檢查程式碼庫中的安全問題並提供修復建議。
Anthropic 在 8 月以兩週衝刺,將 claude.ai 和 Claude 桌面應用程式的核心用戶體驗整體加快至原來約 3 倍。
推薦理由:這次衝刺展示了以可重複基準、CI 效能門檻和分階段上線構成優化閉環的方法,並由工程師把關改動風險與用戶體驗。
Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。
推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。
Simon Willison 與 Jesse Vincent 將於 10 月 14 日在三藩市舉辦智能體工程交流活動,面向使用編程智能體或基於其開發項目的人士。活動以非正式展示交流形式進行,鼓勵分享尚未公開的實驗或未完成項目;毋須準備簡報,亦不作產品推介。
Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。
《The Pragmatic Engineer》訪問 Microsoft Windows 團隊,分析 Windows 在作業系統層整合 AI 智能體與本地模型的計劃。
Apple 宣佈新款 Mac mini 和 Mac Studio 今日開售,Mac mini 配備 M6 或 M5 Pro,Mac Studio 則配備 M5 Max 或 M5 Ultra。
NVIDIA 發佈 Isaac ROS 5.0,加入讓開發者與 AI 智能體協作構建機械人的工作流,並支援 ROS Lyrical 和 Ubuntu 24.04。
推薦理由:Isaac ROS 5.0 把智能體工作流、可重用技能和平台支援納入開源機械人開發,呈現開發工具銜接 Jetson 部署的實作路徑。
這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。
Parallel 的智能體使用 GPT-6 Astra 研究並綜合勞動市場數據,較先前模型所需時間減半,成本亦減半。
vllm-metal 把 vLLM 的排程器、分頁 KV cache 和 OpenAI 相容伺服器帶到 Apple Silicon,並以 MLX 和 Metal 執行模型。
OpenClaw 正加入可選的決策模型支援,讓平台支援的功能及插件使用另行設定的模型,且不會取代對話模型。Plugin SDK 提供共用 API `api.runtime.decisions.evaluate`;TypeSafe adapter 支援託管版 Jev 及本地 System One 伺服器,例如 Kev。
Amazon Science 團隊介紹三項研究,分別用 MochiBind 排序抗體結合力、用 CA-MAP 預測抗體可開發性,並以 Agent 協助設計及實驗驗證抗體。
OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。
YC 2026 夏季批次的 236 家公司中,91% 與 AI 相關,創業方向由應用層轉向模型以下的基礎設施及實體世界。與春季批次相比,模型以下公司佔比由 8% 升至 20%,應用層由 55% 降至 39%;推出自主 Agent 的公司比例由 45% 降至 33%。夏季批次有 45 家公司交付實體硬件,為春季批次的兩倍;另有 21 家公司投入算力建設。
Trail of Bits 為審計 Miden VM,先花六個月以 AI 智能體從零建置工具,再在審計中發現安全漏洞。工具包括 LSP 伺服器、反編譯器、靜態分析引擎及 VM 執行器的 Lean 模型;分析找出逾 400 處可改善類型驗證的位置,並發現一項可讓惡意證明者偽造 Falcon 簽章、盜取由 Falcon 金鑰對控制的 Miden 帳戶資金的高危漏洞。
OpenClaw 推出原子更新機制,準備更新時會維持現有 gateway 運作,更新失敗則回復至上一個可用設定,並保留可協助診斷問題的 Agent。同時,OpenClaw 推出更新問題回報按鈕。Jason Sy 表示新流程在不少情況下有效,但尚未稱更新問題已完全解決。
Sierra 通過 Schellman 獨立審核及 AIUC 測試,取得專為 AI 智能體設計的 AIUC-1 認證。測試涵蓋聊天及語音智能體的日常互動、對抗情境和真實語音條件,包括他人嘗試操控智能體、存取受保護資訊或令其超越授權範圍的情境。相關技術評估至少每季重複,並每年進行全面審核。
Microsoft 根據自身數百項 AI 轉型實踐,總結出五項經驗,涵蓋以業務成果為先、重設端到端流程及讓員工參與等做法。文中舉例,銷售團隊成交率提高 20%,部分供應鏈工作流程週期縮短最多 75%,而一支 9 人工程團隊在 35 天內交付初始產品版本。Microsoft Frontier Playbook 整理了數百項轉型實踐,提供按職位、工作流程或全新業務機會調整的實踐模式。
Pragmatic Engineer主持人Gergely Orosz訪問Matt Pocock,討論他為AI編碼智能體建立可重用技能的做法,以及軟件工程基本原則如何適用於智能體開發。
OpenAI 探索以 AI 驅動的全新廣告體驗,涵蓋 Sponsored Agents、面向營銷人員的工具,以及與 HubSpot 和 Shopify 的整合。
GPT-6 Astra 協助 Hex 的資料智能體將答案轉化為互動式視覺化內容,令員工引以為傲並樂於分享。