Reachy Mini 對話應用新增 MCP 遠端工具支援
Reachy Mini 對話應用現可透過 MCP 調用託管於公開 Hugging Face Spaces 的工具,新增能力時毋須把工具程式碼下載到本機。
Reachy Mini 對話應用現可透過 MCP 調用託管於公開 Hugging Face Spaces 的工具,新增能力時毋須把工具程式碼下載到本機。
OpenAI 的 GPT-Rosalind-5.5 系統卡指出,該模型由 GPT-5.5 增量訓練而成,面向進階生命科學研究,並以可信存取及負責任部署作為主要保障。
H Company 發佈 Holo3.1 電腦操作模型系列,擴展至網頁、桌面及手機環境,並提供本地推理量化權重。AndroidWorld 上,35B-A3B 模型的分數由 67% 升至 79.3%,4B 和 9B 版本由 58% 升至 72%。
推薦理由:文章同時列出不同尺寸、量化格式,以及 AndroidWorld 和 DGX Spark 數據,讀者可據此比較本地部署的性能與速度取捨。
OpenAI 為 Codex 帶來新外掛、網站與標註,協助分析師、營銷人員、設計師、投資者及其他團隊運用 AI 完成更多工作。
JetBrains 發佈 Mellum2,一款以自然語言和程式碼從零訓練的 12B MoE 模型,每個 token 啟用 2.5B 參數。模型採 Apache 2.0 授權,適用於路由、RAG、摘要、子智能體及高吞吐程式功能等工作負載。
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。
Endava 使用 Codex 建構智能體組織,以加快軟件交付,並將需求分析時間由數週縮短至數小時。
Mistral AI 發佈開源 Search Toolkit 公開預覽版,將資料匯入、檢索與評估整合為共享介面的 AI 搜索框架。它內置 BM25 稀疏檢索、基於嵌入向量的密集檢索及混合檢索,並提供 recall、precision、MRR 和 NDCG 指標,可在自有測試集評估。框架可在雲端、本地部署及邊緣環境運行,並提供 starter app template。
Manus 的 Notion 連接器可讀取資料庫結構、跨工作區搜尋,並在授權範圍內寫入結構化資料和更新頁面,讓 Notion 工作區支援工作流程執行。文章示範用它建立趨勢資料庫與定時研究、交叉參照客户紀錄撰寫提案,以及製作銷售管道儀錶板。使用者可指定 Manus 存取的頁面和資料庫,並隨時撤銷權限;文章建議對外分享前審核 AI 生成內容。
OpenAI、Thrive 與 Crete 使用 Codex 構建自我改進的税務智能體,實現申報自動化、提升準確度並加快工作流程。
Hugging Face 梳理 AI 智能體常見術語,解釋 Model、Scaffolding、Harness、Agent 等概念及其區別。文中將 Harness 定義為調用模型、處理工具調用及決定何時停止的執行層,Scaffolding 則涵蓋系統提示詞、工具描述、回應解析和上下文管理等行為定義層。
推薦理由:文章以模型、Scaffolding、Harness 與 Agent 的分工建立實用心智模型,並把這套脈絡延伸至訓練術語,便於理解智能體系統的組成與相關討論。
Manus 推出 Shopify on Manus,讓用户透過對話建立店舖、管理商品目錄及營運營銷活動。Manus 建構店舖前端並透過 Shopify API 讀寫商品、價格、商品系列及折扣;Shopify 處理商品目錄、結帳和支付,兩邊變更保持同步。功能即日起向所有 Manus 付費等級開放,支援正式營運及開發店舖。
Mistral AI 宣佈已達成收購 Physics AI 公司 Emmi AI 的最終協議,以擴充工業工程領域的模型與專業能力。Emmi AI 的聯合創辦人及 30 多名研究人員和工程師將於 5 月加入 Mistral AI 的 Science 和 Applied AI 團隊。Mistral AI 表示,Emmi AI 的模型將補充其自有模型,並支持打造工程師智能體、推進即時模擬及數碼孿生。
推薦理由:收購將 Emmi AI 的 Physics AI 專長、工程模型及逾 30 名研究人員與工程師納入 Mistral AI,呈現其拓展工業工程能力的具體路徑。
Google 宣稱一組 AI 智能體花費 $916.92 建成作業系統,但作者認為公開資料不足以獨立核實。這次執行共使用 2.6B tokens;Google 所稱的單一提示詞長達數千行,但提示詞、程式碼及執行紀錄均未公開,人工介入與重試情況亦未交代。作者將此類長時程任務視為開放世界評測,認為其可補充基準評測,但需要新的方法規範。
Mistral 推出 Mistral Medium 3.5 公開預覽,並以此支援 Mistral Vibe 雲端遠端編碼代理及 Le Chat 的 Work mode。
推薦理由:材料展示模型、雲端編碼代理與 Le Chat 多步驟工具流程的連接方式,能看出長程任務如何落入具體產品工作流。
Mistral AI 在 Studio 推出 Connectors,內置連接器及自訂 MCP 現可透過 API/SDK 用於模型與 Agent 調用。開發者可直接調用工具、程式化建立和管理連接器,並在工具執行前加入人工確認流程。Connectors 目前於 Studio 開放 Public Preview,集中註冊的連接器亦可供 LeChat 和 AI Studio 使用,Vibe 即將推出。
推薦理由:連接器把 MCP 整合封裝成可跨對話、Agent 與工作流重用的項目,並以直接調用和人工確認保留工具執行控制。
Claude Platform 5 月 19 日推出 MCP tunnels 研究預覽,並為 Claude Managed Agents 提供自託管沙箱。MCP tunnels 可連接私有網絡中的 MCP 伺服器;進行中的工作階段可更新 MCP 伺服器及工具設定,自託管沙箱則提供 Anthropic 基礎設施以外的工具執行選項。
Import AI 第 457 期整理 fast16 對高精度計算工具的篡改、Muon optimizer 的神經元死亡問題、正向對齊及 AI 自動化研究等內容。
Google DeepMind 為 Project Genie 加入 Street View 地點錨定能力,並開始向全球符合資格的 Google AI Ultra $200 訂閲者逐步開放(18+)。
推薦理由:Project Genie 把美國 Street View 地點作為生成世界的起始位置,並可套用不同風格,具體呈現真實地理影像如何用於構建虛擬環境。
Manus 定時任務 2.0 擴展週期性工作的執行場景,支援沿用同一任務上下文、項目設定,或在 Manus 建構的網頁應用中定時運行。用户可選擇每次運行留在同一任務或建立獨立任務,並透過側邊欄、日程及日曆視圖查看排程和運行結果。該功能目前已向所有用户開放。
Google DeepMind 推出 Gemini for Science,涵蓋 Google Labs 三項科學研究實驗及 Google Antigravity 的 Science Skills。
推薦理由:三項實驗工具分別對應假設生成、計算探索與文獻整理,呈現 Gemini for Science 將 AI 智能體引入科研流程不同環節的設計。
Google DeepMind宣佈在新加坡推出多項AI合作計劃,並參與Google與新加坡政府的全國AI夥伴關係。計劃涵蓋醫療與生命科學、科研、教育及可持續發展,並推進多模態與多語言安全基準研究;Gemini for Education已提供予小學至初級學院的所有教育工作者。
愛丁堡大學的 Filippo Menolascina 團隊使用 Co-Scientist 梳理 MASH 文獻,提出後經實驗驗證的肝病機製假説。針對近期獲批、用於 MASH 特定階段的 resmetirom 僅對少部分合資格患者有效的問題,該假説將 NLRP3 炎症小體指為連接疾病中炎症與代謝的分子橋樑。
Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。
推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
Databricks 將 GPT-5.5 用於企業智能體工作流程。GPT-5.5 此前在 OfficeQA Pro benchmark 上創下新的最佳水平。
Manus 深化與 Similarweb 的整合,新增對關鍵詞、引薦來源、着陸頁及熱門頁面的分析,讓研究不再侷限於網站流量總量。Manus Pro 用户每月可獲最多 20,000 credits,在 Manus 內按需使用 Similarweb API 數據,毋須訂閲 Similarweb;不同指標按單位消耗數據積分。
OpenAI 為 Codex 在 Windows 上構建安全有效的沙盒,支援 Codex 在 Windows 上運行。沙盒設有受控檔案存取及網絡限制。
Google DeepMind 公佈以 Gemini 構建的 Co-Scientist 多智能體科研系統,將逐步向研究人員開放。Hypothesis Generation 實驗工具將於未來數週開始推出,研究人員可在 labs.google/science 登記意向;系統以專職智能體生成、辯論和演化假設,再用 Elo-based tournament 排序並交叉核查文獻與數據。
推薦理由:Co-Scientist 以多智能體迭代生成、辯論和篩選科研假設,肝纖維化案例亦列出一項候選藥物在實驗室阻斷 91% 疤痕相關反應的結果。
Manus 更新 Browser Operator,新增「首選瀏覽器」功能,讓使用者指定已授權的 Chrome 作為網頁任務環境。該瀏覽器可保留登入狀態、擴充功能、權限和網絡存取,使用者亦可在另一台電腦啟動任務,讓 Manus 使用其 Chrome 工作階段。若首選瀏覽器離線,Manus 可退回另一個可用且已授權的瀏覽器;功能可用性或因帳户和推出狀態而異。
OpenAI 透過沙箱、審批、網絡政策及智能體原生遙測,安全運行 Codex。這些措施支援安全且合規地採用編碼智能體。
Parloa 利用 OpenAI 模型驅動可擴展、語音驅動的 AI 客户服務智能體,讓企業能設計、模擬並部署可靠的即時互動。
Uber 藉助 OpenAI 為全球即時市場提供 AI 助手及語音功能,協助司機更精明地賺取收入,並讓乘客更快預訂。
OpenAI 的 B2B Signals 研究展示前沿企業如何深化 AI 採用、擴大 Codex 驅動的智能體工作流程,並建立持久競爭優勢。
Manus 為 Project 推出可從任務對話中識別可複用知識,並建議更新指令、文件或技能的功能。建議內容須經審查並獲批准後才會套用。此功能適用於支援 Project 指令和 Project 文件的 Project 會話。
OpenAI 與 PwC 合作,協助企業運用 AI 智能體自動化財務工作流程,並推動 CFO 職能現代化。合作亦旨在改善預測及強化管控。
Manus 現可在對話中識別任務所需但尚未啟用的連接器,經用户確認後協助啟用並繼續完成任務。若連接器需要登入或額外授權,用户仍須完成相應流程,Manus 不會繞過權限控制。此功能目前適用於所有 Manus 任務,並支援流動端。
Jack Clark 根據公開研究與產品進展,估計到 2028 年底前,AI 系統自主訓練後繼模型、實現無人參與 AI 研發的機率約為 60%。他以 SWE-Bench 成績由 Claude 2 的約 2% 升至 Claude Mythos Preview 的 93.9%,以及 AI 在研究復現、模型微調和長時間任務上的進展,作為主要依據。
OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。
推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。