Mistral AI 推出 Vibe,整合工作任務與程式開發
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。
讓模型自主規劃、調用工具、完成多步任務的技術方向——從 Claude Code、Manus 到各家 Agent 框架與評測基準的全部動態。
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。
Hugging Face 梳理 AI 智能體常見術語,解釋 Model、Scaffolding、Harness、Agent 等概念及其區別。文中將 Harness 定義為調用模型、處理工具調用及決定何時停止的執行層,Scaffolding 則涵蓋系統提示詞、工具描述、回應解析和上下文管理等行為定義層。
推薦理由:文章以模型、Scaffolding、Harness 與 Agent 的分工建立實用心智模型,並把這套脈絡延伸至訓練術語,便於理解智能體系統的組成與相關討論。
Mistral AI 宣佈已達成收購 Physics AI 公司 Emmi AI 的最終協議,以擴充工業工程領域的模型與專業能力。Emmi AI 的聯合創辦人及 30 多名研究人員和工程師將於 5 月加入 Mistral AI 的 Science 和 Applied AI 團隊。Mistral AI 表示,Emmi AI 的模型將補充其自有模型,並支持打造工程師智能體、推進即時模擬及數碼孿生。
推薦理由:收購將 Emmi AI 的 Physics AI 專長、工程模型及逾 30 名研究人員與工程師納入 Mistral AI,呈現其拓展工業工程能力的具體路徑。
Mistral 推出 Mistral Medium 3.5 公開預覽,並以此支援 Mistral Vibe 雲端遠端編碼代理及 Le Chat 的 Work mode。
推薦理由:材料展示模型、雲端編碼代理與 Le Chat 多步驟工具流程的連接方式,能看出長程任務如何落入具體產品工作流。
Mistral AI 在 Studio 推出 Connectors,內置連接器及自訂 MCP 現可透過 API/SDK 用於模型與 Agent 調用。開發者可直接調用工具、程式化建立和管理連接器,並在工具執行前加入人工確認流程。Connectors 目前於 Studio 開放 Public Preview,集中註冊的連接器亦可供 LeChat 和 AI Studio 使用,Vibe 即將推出。
推薦理由:連接器把 MCP 整合封裝成可跨對話、Agent 與工作流重用的項目,並以直接調用和人工確認保留工具執行控制。
Google DeepMind 為 Project Genie 加入 Street View 地點錨定能力,並開始向全球符合資格的 Google AI Ultra $200 訂閲者逐步開放(18+)。
推薦理由:Project Genie 把美國 Street View 地點作為生成世界的起始位置,並可套用不同風格,具體呈現真實地理影像如何用於構建虛擬環境。
Google DeepMind 推出 Gemini for Science,涵蓋 Google Labs 三項科學研究實驗及 Google Antigravity 的 Science Skills。
推薦理由:三項實驗工具分別對應假設生成、計算探索與文獻整理,呈現 Gemini for Science 將 AI 智能體引入科研流程不同環節的設計。
Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。
推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
Google DeepMind 公佈以 Gemini 構建的 Co-Scientist 多智能體科研系統,將逐步向研究人員開放。Hypothesis Generation 實驗工具將於未來數週開始推出,研究人員可在 labs.google/science 登記意向;系統以專職智能體生成、辯論和演化假設,再用 Elo-based tournament 排序並交叉核查文獻與數據。
推薦理由:Co-Scientist 以多智能體迭代生成、辯論和篩選科研假設,肝纖維化案例亦列出一項候選藥物在實驗室阻斷 91% 疤痕相關反應的結果。
OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。
推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
OpenAI 的 GPT models、Codex 與 Managed Agents 現已在 AWS 提供。OpenAI 表示,企業可在 AWS 環境建構安全 AI。
推薦理由:這項 AWS 上線交代了 OpenAI GPT models、Codex 與 Managed Agents 的可用範圍,也説明企業可在 AWS 環境建構安全 AI 的使用場景。
Mistral AI 開放企業 AI 編排層 Workflows 公開預覽,讓開發者以 Python 編寫流程,並可發佈至 Le Chat 供組織成員觸發。Workflows 提供持久執行、Studio 逐步追蹤及人工審批暫停與恢復,並支援將 workers 和資料處理部署在企業自有環境。
推薦理由:Workflows 將持久執行、Studio 追蹤與人工審批整合,並支援 workers 在企業自有環境運行,呈現企業 AI 流程走向生產的部署設計。
深度求索(DeepSeek)發佈 DeepSeek-V4,Pro、Flash 系列各有 instruct 與 base 版本,四款 checkpoint 均支援 1M-token 上下文。
推薦理由:文章把 KV cache 成本、混合注意力設計與智能體工作流串連起來,並以基準數據呈現長上下文能力在工具任務中的表現。
Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。
推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。
OpenAI 更新 Agents SDK,加入原生沙盒執行與模型原生 harness。這些更新旨在協助開發者構建可跨文件和工具運作的安全、長時間運行智能體。
推薦理由:更新把原生沙盒執行和模型原生 harness 納入 Agents SDK,呈現其對安全、長時間運行智能體跨文件與工具工作的支持。
HCompany 推出免費 Chrome 擴充功能 HoloTab,讓用户無需設定或技術技能,即可由 AI 智能體在瀏覽器中執行網站任務。用户可錄製操作並沿途講述目的,生成 routine 後再重跑或排程執行。HoloTab 已開放使用:https://chromewebstore.google.com/detail/holotab/hlaoiikljjgcjdhkakedfngifaopbcop
推薦理由:HoloTab把網頁操作交給瀏覽器內的智能體,並以錄製操作、補充講述來生成可重跑或排程的流程,呈現重複網頁任務的自動化方式。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。