跳到正文

Agent 智能體

讓模型自主規劃、調用工具、完成多步任務的技術方向——從 Claude Code、Manus 到各家 Agent 框架與評測基準的全部動態。

最新精選

第 101–120 條 · 共 137 條
11月19日週三
  1. Google DeepMind81

    Google 發佈 Antigravity 智能體開發平台,免費開放公開預覽

    Google 推出 Antigravity 智能體開發平台,並免費開放公開預覽。平台保留 AI IDE 編輯器,另設以智能體為核心的 Manager,支援瀏覽器控制及非同步互動,讓智能體自主規劃和執行端到端軟件任務;Artifacts 可供使用者檢視工作成果並提供回饋。

    推薦理由:Antigravity 將 IDE 編輯與 Agent Manager 分成不同工作介面,並以任務級 Artifacts、驗證結果和非同步回饋呈現及修正智能體工作。

  2. Google Research77

    Google Research 介紹生成式 UI:為各類提示生成客製化視覺互動體驗

    Google Research 介紹生成式 UI 實作,Gemini app 今日起推出 dynamic view 和 visual layout 兩項實驗,Google Search 的 AI Mode 亦加入生成式互動介面。

    推薦理由:文章對照生成式 UI 與標準 LLM 輸出及專家設計網站的偏好結果,並交代生成有時需一分鐘以上及輸出偶有不準確的限制。

11月13日週四
  1. Google DeepMind66

    Google DeepMind 推出 SIMA 2:能在虛擬 3D 世界中遊玩、推理並與你一同學習的智能體

    Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。

    推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。

10月27日週一
10月23日週四
  1. Hugging Face Blog62

    Meta 與 Hugging Face 推出 OpenEnv Hub,發布 OpenEnv 0.1 Spec(RFC)

    Meta 與 Hugging Face 合作推出 OpenEnv Hub,供開發者建立、分享和探索可用於訓練與部署的智能體環境。OpenEnv 以沙盒封裝任務所需工具、API、憑證及執行上下文,並提供清晰語義與隔離控制;團隊同時發布 OpenEnv 0.1 Spec(RFC)徵求社羣意見。

    推薦理由:OpenEnv 將智能體任務所需的工具、API、憑證與執行上下文封裝成可分享環境,並銜接訓練和部署,呈現環境規格化的實際用途。

10月6日週一
9月29日週一
9月22日週一
  1. Hugging Face Blog68

    Gaia2 智能體基準與 ARE 框架推出,支援複雜互動評測

    Hugging Face 推出 Gaia2 智能體基準及 Meta Agents Research Environments(ARE)框架,用於在更複雜、接近真實情境的環境中執行、除錯和評估智能體。

    推薦理由:Gaia2 將智能體評測從唯讀檢索擴展至含模糊指令、時間要求和環境故障的互動任務,ARE 記錄執行 traces,便於分析智能體在複雜情境中的失誤。

9月15日週一
  1. OpenAI News63

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。

    推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。

8月5日週二
  1. OpenAI Developers76

    如何用 Ollama 在本地運行 OpenAI gpt-oss

    OpenAI 介紹用 Ollama 在本地運行兩款 gpt-oss 模型,支援離線聊天、API 調用及接入 Agents SDK。gpt-oss-20b 建議至少 16GB VRAM 或 unified memory,gpt-oss-120b 至少 60GB;模型預設採用 MXFP4 量化,VRAM 不足時可用 CPU,但速度較慢。

    推薦理由:指南比較兩個模型所需的硬件配置,並串起本地聊天、Chat Completions API 與 Agents SDK 接入步驟,便於評估本地部署路徑。

7月31日週四
  1. Hugging Face Blog62

    用 Python 實作 MCP 伺服器:以 Gradio 建立 AI 購物助手

    文章示範如何以 Gradio 在 Python 中實作 MCP 伺服器,並建立可瀏覽服裝網站、呼叫 IDM-VTON 虛擬試穿的 AI 購物助手。Gradio 會把應用程式的 API endpoint 自動轉為具名稱、描述及輸入 schema 的 MCP 工具,並支援即時進度通知和自動檔案上傳。

    推薦理由:示例將 Gradio MCP 伺服器、Playwright 網頁瀏覽與 IDM-VTON 虛擬試穿串成工作流程,並列出 VS Code 設定步驟。

7月30日週三
7月17日週四
  1. Mistral AI69

    Mistral AI 為 Le Chat 推出 Deep Research、語音等新功能

    Mistral AI 為 Le Chat 推出 Deep Research、語音、多語言推理、Projects 和圖片編輯等新功能。Deep Research(Preview)可搜尋可信來源並生成附參考資料的結構化報告,語音模式採用 Voxtral,多語言推理由 Magistral 驅動,圖片編輯則與 Black Forest Labs 合作。

    推薦理由:Le Chat 把研究、語音、多語言推理、Projects 與圖片編輯納入同一產品,呈現其如何覆蓋資訊整理、語音互動和圖像修改等不同任務。

7月11日週五
  1. Mistral AI67

    Mistral AI 發佈 Devstral Medium 和升級版 Devstral Small 1.1,強化智能體編碼能力

    Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。

    推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。

7月10日週四
5月27日週二
  1. Mistral AI70

    使用 Mistral Agents API 構建 AI 智能體

    Mistral AI 發佈 Agents API,將內置連接器、跨對話記憶及智能體編排整合為構建 AI 智能體的框架。內置連接器涵蓋代碼執行、網絡搜索、圖像生成、Document Library 及 MCP 工具;啟用網絡搜索後,Mistral Large 和 Mistral Medium 在 SimpleQA 的分數分別由 23% 和 22.08% 升至 75% 和 82.32%。

    推薦理由:Agents API 把內置連接器、跨對話記憶和多智能體編排納入同一框架,並以 SimpleQA 數據呈現網絡搜索前後的分數差異。

5月21日週三
5月7日週三
3月7日週五
  1. Mistral AI69

    Mistral OCR 推出文件理解 API,支援圖片與 PDF 解析

    Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。

    推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。