跳到正文

#Agent

今日 161 條
6月3日週三
6月2日週二
  1. Hugging Face Blog63

    Holo3.1 系列發佈,擴展電腦操作至手機並提供本地量化權重

    H Company 發佈 Holo3.1 電腦操作模型系列,擴展至網頁、桌面及手機環境,並提供本地推理量化權重。AndroidWorld 上,35B-A3B 模型的分數由 67% 升至 79.3%,4B 和 9B 版本由 58% 升至 72%。

    推薦理由:文章同時列出不同尺寸、量化格式,以及 AndroidWorld 和 DGX Spark 數據,讀者可據此比較本地部署的性能與速度取捨。

6月1日週一
5月28日週四
  1. Mistral AI76

    Mistral AI 推出 Vibe,整合工作任務與程式開發

    Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。

    推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。

  2. Mistral AI56

    Mistral AI 推出開源 Search Toolkit 公開預覽版

    Mistral AI 發佈開源 Search Toolkit 公開預覽版,將資料匯入、檢索與評估整合為共享介面的 AI 搜索框架。它內置 BM25 稀疏檢索、基於嵌入向量的密集檢索及混合檢索,並提供 recall、precision、MRR 和 NDCG 指標,可在自有測試集評估。框架可在雲端、本地部署及邊緣環境運行,並提供 starter app template。

  3. Manus:Blog53

    Manus 的 Notion 連接器如何讓 Notion 成為工作流程引擎

    Manus 的 Notion 連接器可讀取資料庫結構、跨工作區搜尋,並在授權範圍內寫入結構化資料和更新頁面,讓 Notion 工作區支援工作流程執行。文章示範用它建立趨勢資料庫與定時研究、交叉參照客户紀錄撰寫提案,以及製作銷售管道儀錶板。使用者可指定 Manus 存取的頁面和資料庫,並隨時撤銷權限;文章建議對外分享前審核 AI 生成內容。

5月27日週三
5月25日週一
  1. Hugging Face Blog60

    AI 智能體中的 Harness、Scaffold 等術語解析

    Hugging Face 梳理 AI 智能體常見術語,解釋 Model、Scaffolding、Harness、Agent 等概念及其區別。文中將 Harness 定義為調用模型、處理工具調用及決定何時停止的執行層,Scaffolding 則涵蓋系統提示詞、工具描述、回應解析和上下文管理等行為定義層。

    推薦理由:文章以模型、Scaffolding、Harness 與 Agent 的分工建立實用心智模型,並把這套脈絡延伸至訓練術語,便於理解智能體系統的組成與相關討論。

5月23日週六
  1. Mistral AI60

    Mistral AI 宣佈達成收購 Emmi AI 的最終協議,拓展工業 AI 能力

    Mistral AI 宣佈已達成收購 Physics AI 公司 Emmi AI 的最終協議,以擴充工業工程領域的模型與專業能力。Emmi AI 的聯合創辦人及 30 多名研究人員和工程師將於 5 月加入 Mistral AI 的 Science 和 Applied AI 團隊。Mistral AI 表示,Emmi AI 的模型將補充其自有模型,並支持打造工程師智能體、推進即時模擬及數碼孿生。

    推薦理由:收購將 Emmi AI 的 Physics AI 專長、工程模型及逾 30 名研究人員與工程師納入 Mistral AI,呈現其拓展工業工程能力的具體路徑。

  2. AI as Normal Technology59

    Google 的 AI 智能體真的花 $916 建成作業系統嗎?

    Google 宣稱一組 AI 智能體花費 $916.92 建成作業系統,但作者認為公開資料不足以獨立核實。這次執行共使用 2.6B tokens;Google 所稱的單一提示詞長達數千行,但提示詞、程式碼及執行紀錄均未公開,人工介入與重試情況亦未交代。作者將此類長時程任務視為開放世界評測,認為其可補充基準評測,但需要新的方法規範。

5月22日週五
  1. Mistral AI70

    Mistral AI 在 Studio 推出 Connectors,支援內置與自訂 MCP

    Mistral AI 在 Studio 推出 Connectors,內置連接器及自訂 MCP 現可透過 API/SDK 用於模型與 Agent 調用。開發者可直接調用工具、程式化建立和管理連接器,並在工具執行前加入人工確認流程。Connectors 目前於 Studio 開放 Public Preview,集中註冊的連接器亦可供 LeChat 和 AI Studio 使用,Vibe 即將推出。

    推薦理由:連接器把 MCP 整合封裝成可跨對話、Agent 與工作流重用的項目,並以直接調用和人工確認保留工具執行控制。

5月19日週二
  1. Claude Platform:開發者版本說明62

    Claude Platform 2026 年 5 月 19 日更新推出 MCP tunnels 研究預覽及 Claude Managed Agents 自託管沙箱

    Claude Platform 5 月 19 日推出 MCP tunnels 研究預覽,並為 Claude Managed Agents 提供自託管沙箱。MCP tunnels 可連接私有網絡中的 MCP 伺服器;進行中的工作階段可更新 MCP 伺服器及工具設定,自託管沙箱則提供 Anthropic 基礎設施以外的工具執行選項。

5月18日週一
  1. Google DeepMind62

    Google DeepMind 為 Project Genie 加入 Street View 功能,並向全球合資格 Google AI Ultra 訂閲者逐步開放

    Google DeepMind 為 Project Genie 加入 Street View 地點錨定能力,並開始向全球符合資格的 Google AI Ultra $200 訂閲者逐步開放(18+)。

    推薦理由:Project Genie 把美國 Street View 地點作為生成世界的起始位置,並可套用不同風格,具體呈現真實地理影像如何用於構建虛擬環境。

5月17日週日
5月16日週六
  1. Google DeepMind63

    Google DeepMind 的 Co-Scientist 發掘可再利用的抗肝纖維化候選藥物

    Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。

    推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。

5月15日週五
5月14日週四
5月13日週三
5月12日週二
  1. Google DeepMind64

    Google DeepMind 公佈 Co-Scientist 多智能體科研系統,並將推出 Hypothesis Generation 實驗工具

    Google DeepMind 公佈以 Gemini 構建的 Co-Scientist 多智能體科研系統,將逐步向研究人員開放。Hypothesis Generation 實驗工具將於未來數週開始推出,研究人員可在 labs.google/science 登記意向;系統以專職智能體生成、辯論和演化假設,再用 Elo-based tournament 排序並交叉核查文獻與數據。

    推薦理由:Co-Scientist 以多智能體迭代生成、辯論和篩選科研假設,肝纖維化案例亦列出一項候選藥物在實驗室阻斷 91% 疤痕相關反應的結果。

  2. Manus:Blog54

    Manus 為 Browser Operator 加入「首選瀏覽器」,可從其他電腦使用指定 Chrome

    Manus 更新 Browser Operator,新增「首選瀏覽器」功能,讓使用者指定已授權的 Chrome 作為網頁任務環境。該瀏覽器可保留登入狀態、擴充功能、權限和網絡存取,使用者亦可在另一台電腦啟動任務,讓 Manus 使用其 Chrome 工作階段。若首選瀏覽器離線,Manus 可退回另一個可用且已授權的瀏覽器;功能可用性或因帳户和推出狀態而異。

5月8日週五
5月7日週四
5月6日週三
5月5日週二
  1. Manus:Blog50

    Manus 推出對話中的連接器推薦與啟用功能

    Manus 現可在對話中識別任務所需但尚未啟用的連接器,經用户確認後協助啟用並繼續完成任務。若連接器需要登入或額外授權,用户仍須完成相應流程,Manus 不會繞過權限控制。此功能目前適用於所有 Manus 任務,並支援流動端。

5月4日週一
5月1日週五
  1. OpenAI:失準報告與通報76

    OpenAI 説明 Auto-review 如何在無同步人工監督下審核 Codex 越界操作

    OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。

    推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。

4月30日週四
  1. Google DeepMind60

    Google DeepMind 宣佈 AI co-clinician 醫療研究計劃,探索醫療協作模式

    Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。

    推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。