跳到正文

Agent 智能體

讓模型自主規劃、調用工具、完成多步任務的技術方向——從 Claude Code、Manus 到各家 Agent 框架與評測基準的全部動態。

最新精選

第 81–100 條 · 共 137 條
4月2日週四
  1. Hugging Face Blog85

    Google DeepMind 發佈 Gemma 4 多模態模型系列,五種尺寸登陸 Hugging Face

    Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。

    推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。

3月25日週三
  1. Google Research62

    Google Research 推出 Vibe Coding XR,以 Gemini 和 XR Blocks 生成 Android XR 原型

    Google Research 宣佈 Vibe Coding XR,結合 Gemini 與 XR Blocks,將自然語言描述轉成具物理感知能力的 Android XR 應用,最快可在 60 秒內生成。

    推薦理由:文章展示如何以 XR Blocks 架構、範例模板和專用系統提示詞約束 Gemini,令自然語言生成的 XR 原型遵循既有 API 與互動設計規範。

3月17日週二
3月16日週一
  1. Manus:Blog78

    Manus 推出桌面應用程式核心功能「我的電腦」,連接雲端智能體與本機資源

    Manus 推出桌面應用程式核心功能「我的電腦」,讓雲端智能體透過終端命令讀取、分析和編輯本機檔案,並啟動及控制本機應用程式。用户可新增並授權本機資料夾;執行每項命令前須明確批准,亦可選擇「始終允許」或「僅允許一次」。該功能現已向 macOS 和 Windows 用户開放。

    推薦理由:Manus 將雲端智能體延伸至本機檔案與應用程式,並透過命令授權讓自動化能力與用户對本機操作的控制並存。

3月10日週二
  1. Hugging Face Blog70

    Hugging Face Hub 推出 Storage Buckets,提供可變的 S3 類物件儲存

    Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。

    推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。

2月27日週五
2月13日週五
2月2日週一
1月28日週三
12月29日週一
  1. Manus:Blog78

    Manus 加入 Meta,開啟新一輪探索

    Manus 宣佈即將加入 Meta,並表示會繼續透過 app 和網站提供產品及訂閲服務,公司亦會繼續在新加坡營運。按 12 月初統計,自上線以來 Manus 已處理超過 147 萬億個 token,並建立超過 8000 萬台虛擬電腦。首席執行官肖弘表示,與 Meta 攜手可讓 Manus 在不改變運作方式和決策機制的前提下,在更強大、更可持續的基礎上發展。

    推薦理由:公告交代 Manus 加入 Meta 後產品服務及新加坡營運安排,並列出上線以來的使用規模,呈現組織變動與現有服務延續的關係。

12月17日週三
12月13日週六
  1. Google DeepMind78

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,推出即時語音翻譯測試版

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。

    推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。

12月11日週四
  1. OpenAI News71

    OpenAI 發佈面向日常專業工作的 GPT-5.2

    OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。

    推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。

12月9日週二
12月4日週四
  1. Hugging Face Blog72

    Hugging Face Skills 讓 Claude Code 微調開源大語言模型

    Hugging Face Skills 讓 Claude Code 等編碼智能體透過對話處理模型微調,涵蓋資料集驗證、GPU 選擇、雲端工作提交與進度監控。它亦兼容 Codex 和 Gemini CLI;文中以 Qwen3-0.6B 在 open-r1/codeforces-cots 上進行 SFT 為例,估算使用 t4-small 約需 20 分鐘、成本約 $0.30。

    推薦理由:文章將資料集驗證、GPU 選擇、雲端工作提交與進度監控串成智能體訓練流程,並比較 SFT、DPO、GRPO 的適用場景。

11月24日週一
  1. Google DeepMind68

    Google DeepMind 支持白宮 Genesis Mission,與美國能源部合作加速科研創新

    Google DeepMind 宣佈支持白宮 Genesis Mission,並與美國能源部合作,向其 17 個國家實驗室的科學家提供 AI for Science 模型及智能體工具。

    推薦理由:合作將 AI for Science 模型及智能體工具分階段提供予美國能源部 17 個國家實驗室,並交代即日起的首階段與 2026 年初的擴展安排。

  2. Claude Platform:開發者版本說明79

    Claude Platform 2025 年 11 月 24 日更新推出 Claude Opus 4.5 及多項 API 功能

    Claude Platform 於 2025 年 11 月 24 日推出 Claude Opus 4.5,面向複雜專業任務、專業軟件工程及進階智能體。更新指出,該模型在視覺、編碼和電腦操作方面有顯著改進,定價亦較此前 Opus 模型更易負擔。

    推薦理由:這批更新為多工具工作流程提供兩種改善方式,程式化工具調用旨在降低延遲和 token 用量,工具搜尋則讓大型工具目錄中的工具可按需載入。

11月19日週三