智能體私隱與安全中的待解及新興問題:情境視角
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Amazon SageMaker AI 推出 aws-ai-ml 技能,讓支援 MCP 的編碼智能體協助最佳化生成式 AI 推理。它可測試現有端點、推薦部署配置、比較基準測試結果,並生成可檢視及執行的 SageMaker Python SDK v3 程式碼;測試報告提供實際基礎設施負載下的吞吐量、延遲和並行數據。
AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。
AWS 文章示範如何以 LangChain 在 Amazon Bedrock Knowledge Bases 建立 RAG 應用,並比較標準檢索與 Agentic retrieval 處理多部分問題的方式。
AWS 示範以部署在 Amazon Bedrock AgentCore 的 Quick Resource Migrator MCP 伺服器,自動化 Amazon Quick 資源的跨帳戶推廣。
AWS 介紹並部署 Adjudicated Query 模式,讓 Amazon Quick 的自然語言合規查詢透過固定 MCP 操作交由確定性規則引擎判定,而非由模型作出決策。
推薦理由:文章把自然語言查詢與合規判定分開,並以完整性收據和逐筆證據鏈展示如何核對大量檢查結果。
AWS 説明如何透過 Amazon Bedrock AgentCore Gateway,將受 JWT 驗證的 Web Search 接入 Claude Desktop on Amazon Bedrock。
AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。
NVIDIA 宣佈 DGX Spark 64GB 配置將於 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 開售,起價 $4,999。
AWS Professional Services 以 Amazon Bedrock AgentCore 部署四智能體方案,協助擴展雲端遷移並處理組織特定需求。
Amazon Quick 推出 Live Data in Apps,讓已發布的 Quick Apps 每次開啟時即時查詢受治理的 Quick Sight 資料集,而非讀取建置時快照。查詢以查看者身份執行並套用其 RLS 與 CLS 權限;每位查看者首次使用每個資料集時須同意,且不支援匿名或公開存取。
文章示範如何將 Amazon S3 Vectors 設為 NVIDIA NeMo Agent Toolkit(NAT)的持久記憶層,並把智能體工作流部署到 Amazon EKS。
Amazon Bedrock AgentCore 的參考實作把 Amazon S3 上傳或排程事件轉成智能體工作,並讓智能體在需要澄清、審批或覆核時暫停等待人員回應。
推薦理由:文章把事件來源、AgentCore 執行與人在迴路處理串成參考架構,並清楚區分樣本內建能力與需自行擴展的訊號來源。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
CoreWeave 宣佈在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,並推出 CoreWeave Forge,推進智能體 AI 從訓練到生產的部署。
推薦理由:文章披露 Cognition 對 Vera Rubin NVL72 與 GB200 NVL72 的 SWE-2 推理測試,列出最高 4.8x 的總 token 吞吐提升,讓兩種平台在智能體編碼工作負載下可作量化比較。
GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。
推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。
AWS 介紹 Amazon Quick 的提示詞工程基礎,整理適用於不同功能的通用原則與可複用框架。文章涵蓋明確具體、提供業務背景、以示例指定輸出,以及 CRISPE、RADAR、ARCHITECT 和 QUEST 等框架,並介紹中繼資料檢索、多角度分析與情境規劃。文中以 RFI 問卷自動化示範 Quick Flow 如何把多工作表資料整理為四欄 CSV,並稱可將原需數小時的處理縮至數分鐘。
OpenAI 推出 dots,這些主動式助理能在複雜項目與日常任務中持續工作。dots 協助使用者在工作推進期間保持掌控。
H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。
推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。
Hugging Face Hub 新增 RL Environments 篩選入口,集中展示帶有 rl-environment 標籤的資料集。資料集可標示 Harbor、Verifiers、OpenEnv、NeMo Gym 的兼容性,並在頁面提供相應的執行命令。標籤只描述兼容性,不會把檔案轉換成其他框架格式,也不會啟動 job 或 sandbox。
GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。
推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,將近乎即時視像生成與語音結合,讓企業智能體以動態虛擬形象進行多模態對話。
NVIDIA 發佈 Isaac ROS 5.0,加入讓開發者與 AI 智能體協作構建機械人的工作流,並支援 ROS Lyrical 和 Ubuntu 24.04。
推薦理由:Isaac ROS 5.0 把智能體工作流、可重用技能和平台支援納入開源機械人開發,呈現開發工具銜接 Jetson 部署的實作路徑。
Parallel 的智能體使用 GPT-6 Astra 研究並綜合勞動市場數據,較先前模型所需時間減半,成本亦減半。
OpenAI 探索以 AI 驅動的全新廣告體驗,涵蓋 Sponsored Agents、面向營銷人員的工具,以及與 HubSpot 和 Shopify 的整合。
GPT-6 Astra 協助 Hex 的資料智能體將答案轉化為互動式視覺化內容,令員工引以為傲並樂於分享。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
OpenAI 在 ChatGPT Work 推出 Data agent,支援連接公司數據、發掘洞察,並透過自然語言以 AI 建立互動式儀錶板。
OpenAI 推出 Agents API,這項由 Codex harness 驅動的託管服務可用於建置及啟動雲端智能體。服務支援編排、長時段工作階段與工具使用。詳情見 https://openai.com/index/introducing-the-agents-api。
推薦理由:這則公告交代 Agents API 將編排、長時段工作階段與工具使用納入雲端智能體託管服務,清楚界定其運作範圍。
OpenAI 內部的編碼智能體正重塑 AI 研究。早期數據涵蓋智能體使用情況、實驗速度、任務複雜度及研究加速。
GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。
推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。
Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。
推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。
Google DeepMind 推出有限度開放的 Fairwind Program,讓政府機構及可信賴夥伴使用進階 AI 網絡防禦能力。計劃把 Gemini 3.8 Flash Cyber 與 CodeMender 結合,用於自主發現、驗證及修復漏洞,並可在機構安全雲端環境內於數分鐘生成經驗證、可部署的修補程式。
推薦理由:Fairwind 將 Gemini 3.8 Flash Cyber 與 CodeMender 結合,讓參與機構在安全雲端環境內生成經驗證、可部署的漏洞修補程式,將人工修補由數週縮至數分鐘。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
Google DeepMind 推出 Gemini 智能體影片理解功能,影片分析成本最多降低 66%、token 用量最多降低 88%,準確度最多提升 7%。
推薦理由:相較固定 FPS 靜態處理,Gemini 會動態檢視畫面、音訊與字幕,影片分析的 token 用量最多減少 88%、成本最多減少 66%。
Basis、Clay 和 Exa Labs 運用 AI 智能體改善客户導入、帳户管理及開發者整合,呈現 AI 原生公司如何把工作流程轉化為營運能力。相關做法可供企業領導者參考。
Google Earth AI 介紹實驗性行星預測引擎(PPE),可根據自然語言查詢自主完成地理空間資料搜尋、整理、模型訓練與評估。測試中,21 項 CDC 健康指標的平均 R² 為 76.8%,高於人工專家流程的 60.0%;尼日利亞糧食安全由 ADM1 下採樣至 ADM2,R² 為 66.1%,基線為 31.5%。
Google Research 提出 AgentHands,將 LLM 回應轉化為與語音同步、能配合 XR 空間場景的手勢。系統透過物件註冊、手勢事件和字級時間戳協調語音播放與動畫;研究以 N = 12 名參與者進行受試者內測試,使用蘭花護理和 3D 打印機操作任務,比較 AgentHands 與純語音基線。
IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。
推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。