跳到正文

Agent 智能體

讓模型自主規劃、調用工具、完成多步任務的技術方向——從 Claude Code、Manus 到各家 Agent 框架與評測基準的全部動態。

最新精選

第 41–60 條 · 共 137 條
8月12日週三
  1. Google Research68

    Google Research 推進 AMIE 邁向專家級視聽臨牀會診

    Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。

    推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。

8月10日週一
  1. Hugging Face Blog77

    Meta 發佈 Muse Glimmer 30B 多模態模型,採用 Apache 2.0 授權並面向本地智能體應用

    Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。

    推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。

7月30日週四
  1. Google DeepMind66

    Google DeepMind 發佈 Gemini Robotics ER 2,支援影片理解、任務編排與多機械人協作

    Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。

    推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。

7月28日週二
  1. Google DeepMind69

    Gemini Robotics 2 為機械人帶來全身智能控制

    Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。

    推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。

7月21日週二
7月17日週五
  1. Google DeepMind65

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber 網絡安全模型

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。

    推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。

7月16日週四
  1. Hugging Face Blog76

    Hugging Face 披露 2026 年 7 月生產基礎設施遭自主 AI 智能體系統入侵

    Hugging Face 披露,其部分生產基礎設施遭自主 AI 智能體系統入侵,攻擊者存取了有限範圍的內部資料集及多項服務憑證。Hugging Face 已封堵相關程式碼執行路徑、重建受影響節點並輪換憑證;目前未發現公開、面向用户的模型、資料集或 Spaces 遭篡改,合作夥伴或客户資料是否受影響仍在評估。

    推薦理由:事件呈現託管模型安全護欄對事故分析的限制,也提供可遷移的準備方向,即預先驗證能在自有基礎設施運行的模型,以保護攻擊資料並維持調查能力。

7月2日週四
6月25日週四
6月24日週三
6月23日週二
  1. Mistral AI60

    Mistral OCR 4 發佈,新增文件區塊定位、分類與信心分數

    Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。

    推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。

6月18日週四
  1. Hugging Face Blog68

    Hugging Face 以 agent-eval 評測開源模型操作 transformers 的成功率與成本

    Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。

    推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。

6月17日週三
  1. Hugging Face Blog78

    GLM-5.2 發佈,最大上下文擴至 1M tokens並提升長程任務能力

    GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。

    推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。

6月11日週四
6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

6月9日週二
  1. Google DeepMind72

    Google DeepMind 發佈 Gemma 4 12B 統一免編碼器多模態模型

    Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。

    推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。

  2. Hugging Face Blog70

    智能體如何串接兩個 Hugging Face Spaces 建成巴黎地標 3D 畫廊

    編碼智能體串接兩個 Hugging Face Spaces,生成巴黎地標圖像及 3D Gaussian splats,並將畫廊部署為靜態 Space mishig/monuments-de-paris。

    推薦理由:案例展示了透過 Hugging Face Spaces 的 agents.md 串接圖像生成與單圖 3D 重建,並以各一句提示複用到日本及埃及主題畫廊,呈現多媒體工作流的可遷移性。

6月4日週四
  1. Hugging Face Blog65

    Hugging Face 如何將 hf CLI 設計成適合 AI 智能體操作 Hugging Face Hub 的入口

    Hugging Face 重建 hf CLI,讓它按使用情境為人類與 AI 智能體提供不同格式的輸出,並以可直接執行的提示引導後續操作。

    推薦理由:Claude Code 與 Codex 參與 18 項 Hub 任務的多輪測試,文章並列成功率與 token 用量,呈現 hf CLI 相較 curl/Python SDK 在多步操作上的差異。

6月2日週二
  1. Hugging Face Blog63

    Holo3.1 系列發佈,擴展電腦操作至手機並提供本地量化權重

    H Company 發佈 Holo3.1 電腦操作模型系列,擴展至網頁、桌面及手機環境,並提供本地推理量化權重。AndroidWorld 上,35B-A3B 模型的分數由 67% 升至 79.3%,4B 和 9B 版本由 58% 升至 72%。

    推薦理由:文章同時列出不同尺寸、量化格式,以及 AndroidWorld 和 DGX Spark 數據,讀者可據此比較本地部署的性能與速度取捨。