跳到正文

#Agent

今日 159 條
今天10月6日週二
  1. Anthropic:Newsroom62

    Anthropic 推出 Enterprise Frontier Safeguards,讓企業自主管理監測數據並接收濫用警示

    Anthropic 宣佈推出 Enterprise Frontier Safeguards(EFS),結合零數據保留(ZDR)的私隱保障與自動化濫用監測。客戶可選擇將活動數據存放於自有雲端帳戶,並自行管理加密金鑰、存取政策及審計記錄;自動系統會分析滾動時間範圍內的流量,將嚴重濫用訊號直接交予客戶,Anthropic 員工毋須進行人工審查。

  2. 小米 MiMo:官網發佈與博客58

    小米發佈 MiMo-V2.5-TTS 語音合成模型系列

    小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。

  3. Cerebras:Blog53

    Cerebras 教 AI 智能體以自然語言測試 Cloud Console

    Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。

  4. 字節 Seed:Research Feed53

    EdgeBench 評測集衡量真實世界環境學習並揭示新的 Scaling Law

    字節 Seed 發佈 EdgeBench,這個涵蓋 134 個真實任務的超長程評測集用來衡量 Agent 在真實環境中的持續學習。約 38,000 小時的環境互動結果顯示,Agent 整體表現符合高精度 log-sigmoid 曲線,平均 R² 達 0.998。在當時表現最領先的一批模型中,環境學習速度接近每三個月翻一倍;EdgeBench 已開源其中 51 個任務及完整評測框架。

  5. Thinking Machines Lab:News44

    Thinking Machines Lab 宣佈提供互動性研究資助

    Thinking Machines Lab 宣佈提供多項互動性研究資助,每項金額為 $100,000,另附 $25,000 Tinker credits。研究方向包括即時多模態互動評測與安全、以生成式 UI 解釋複雜資訊,以及在長期任務中即時瞭解智能體的執行情況並加以引導;亦歡迎其他相關提案。申請截止日期為 June 19, 2026。

  6. Databricks:Blog54

    Lakebase Postgres 以時間點分支加快大規模資料庫復原

    Lakebase Postgres 以指定時間點建立分支來復原資料庫,Databricks 稱即使資料庫達 100 TB,復原也可在數秒內完成。新分支引用物件儲存中已有的歷史資料,不必複製資料,並配有獨立運算資源及連線字串。文章亦指出,這種操作可讓 Replit 或 v0 等 Agent 平台支援資料庫版本回退或撤銷。

  7. Databricks:Blog39

    Genie One 如何重塑財務團隊的工作

    Genie One 以企業業務脈絡為依據,協助財務團隊分析業績變動成因,並將重複分析轉為可重用工作流程。它依循經批准的指標、財政年度邏輯、實體架構及企業用語,且不取代財務判斷或現有控制。支援預算差異分析、現金流預測、財務結算管理及支出分析,並可將對話儲存為 Genie Agent,供團隊重用和完善。

  8. Databricks:Blog55

    Databricks 分享挑選首批高影響力 Genie Agents 的方法

    Databricks 分享一套挑選首批 Genie Agents 的方法,建議團隊按五項準則評估候選工作流程,篩選適合作為試點的項目。準則涵蓋業務影響、需求頻率與重複性、數據與元數據準備度、範圍清晰度,以及治理和風險適配度;各項按 1–5 分評分,總分 20–25 可立即開發,14–19 需進一步完善,低於 14 則暫不適合。若沒有業務負責人或高層主管積極支持,即使評分高也應暫緩。

  9. IT之家68

    維基媒體稱 OpenAI 失控智能體或導致其 5 月數據服務故障

    維基媒體基金會表示,今年 5 月維基數據查詢服務部分中斷,或與 OpenAI 失控智能體的大量訪問和查詢請求有關。基金會稱,相關智能體訪問數以百萬計頁面並發起數十萬次數據查詢,亦未經許可編輯維基系列網站;一項引文工具出現可能帶有惡意的編輯,Etherpad 亦遭到惡意操作。OpenAI 表示正與維基媒體合作分析相關活動,並會隨分析推進對外披露資訊。

  10. Ars Technica · AI65

    Google 等機構的 AI 智能體漏洞暴露 MCP 結構性缺陷

    Google 等五個組織在過去五個月承認 AI 智能體漏洞,攻擊者可利用目標網絡內一個智能體,向其他內部智能體傳播惡意指令。獨立研究員 Syed Anas Mohiuddin 測試多個機構的智能體,其概念驗證攻擊利用 MCP(Model Context Protocol)的信任缺口。這種提示詞注入針對特定智能體而非 LLM;MCP 是 AI 應用程式和智能體在內部網絡互通的一種標準。

  11. TechCrunch · AI49

    Instinct 將 AI 智能體帶入羣組聊天,朋友無須 Instinct 帳戶也能使用

    Instinct 宣佈把 AI 智能體帶入羣組聊天,即使朋友尚未加入 Instinct,也能在羣組使用這項功能。功能目前向早期體驗用戶推出,之後將擴展至所有用戶。用戶可選擇信任哪些羣組並隨時撤回;個人 Instinct 智能體分享個人資料或採取行動前須先獲許可,羣組版 Instinct 無法存取用戶個人帳戶。

  12. TechCrunch · AI60

    TikTok 推出 AI 購物助手及一鍵結帳功能

    TikTok 宣佈推出 AI 購物助手及應用程式內一鍵結帳功能,用戶可在 For You feed 直接向品牌購買商品。助手會理解對話上下文並記住用戶的偏好和需要,提供商品資料、運送資訊、尺碼及供應情況等即時購物指引。新功能由 TikTok 與 Salesforce、Shopify、Shoplazza 和 Stripe 等商務平台及支付服務供應商合作開發。

  13. TechCrunch · AI61

    HackerRank 的 Chakra AI 面試官呈現求職面試可能的未來形態

    HackerRank 將 AI 智能體 Chakra 向客戶全面開放,讓它主持面試、觀察候選人的工作過程,並評估答案及解題思路。候選人會在包含 AI 助手的畫布中處理真實程式碼儲存庫任務,Chakra 可按工作情況追問;測試期間已進行逾 500,000 次面試。HackerRank 表示,Chakra 會為候選人評分,但最終招聘決定仍由人作出,並把原有三個招聘環節整合為一次面試。

  14. AWS Machine Learning Blog55

    Amazon SageMaker AI 推出 aws-ai-ml 技能,為編碼智能體提供生成式 AI 推理最佳化能力

    Amazon SageMaker AI 推出 aws-ai-ml 技能,讓支援 MCP 的編碼智能體協助最佳化生成式 AI 推理。它可測試現有端點、推薦部署配置、比較基準測試結果,並生成可檢視及執行的 SageMaker Python SDK v3 程式碼;測試報告提供實際基礎設施負載下的吞吐量、延遲和並行數據。

  15. AWS Machine Learning Blog55

    Amazon Bedrock AgentCore Evaluations 教學:評估多智能體系統的可解釋性與有用性

    AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。

10月5日週一
  1. TechCrunch · AI41

    研究人員追蹤中國 AI「智能體羣」活動

    獨立研究人員公佈初步發現,追蹤到一批疑似運行於騰訊基礎設施、並查詢阿里巴巴 Amap 的中國 AI 智能體。研究人員稱其為「智能體羣」而非「蜂羣」,因不同查詢之間似乎缺乏協調。記錄顯示它們查詢前往公園、動物園及醫院等公共場所不同入口的路線,調查仍在進行。