跳到正文

#Agent

今日 5 條
4月15日週三
  1. Hugging Face Blog68

    HCompany 推出 HoloTab Chrome 擴充功能,讓 AI 智能體代辦網頁任務

    HCompany 推出免費 Chrome 擴充功能 HoloTab,讓用户無需設定或技術技能,即可由 AI 智能體在瀏覽器中執行網站任務。用户可錄製操作並沿途講述目的,生成 routine 後再重跑或排程執行。HoloTab 已開放使用:https://chromewebstore.google.com/detail/holotab/hlaoiikljjgcjdhkakedfngifaopbcop

    推薦理由:HoloTab把網頁操作交給瀏覽器內的智能體,並以錄製操作、補充講述來生成可重跑或排程的流程,呈現重複網頁任務的自動化方式。

4月13日週一
4月8日週三
4月3日週五
4月2日週四
  1. Hugging Face Blog85

    Google DeepMind 發佈 Gemma 4 多模態模型系列,五種尺寸登陸 Hugging Face

    Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。

    推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。

3月25日週三
  1. Google Research62

    Google Research 推出 Vibe Coding XR,以 Gemini 和 XR Blocks 生成 Android XR 原型

    Google Research 宣佈 Vibe Coding XR,結合 Gemini 與 XR Blocks,將自然語言描述轉成具物理感知能力的 Android XR 應用,最快可在 60 秒內生成。

    推薦理由:文章展示如何以 XR Blocks 架構、範例模板和專用系統提示詞約束 Gemini,令自然語言生成的 XR 原型遵循既有 API 與互動設計規範。

3月24日週二
3月17日週二
3月11日週三
3月10日週二
  1. Hugging Face Blog70

    Hugging Face Hub 推出 Storage Buckets,提供可變的 S3 類物件儲存

    Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。

    推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。

3月6日週五
2月27日週五
2月26日週四
2月23日週一
2月18日週三
2月13日週五
2月11日週三
  1. Google Research49

    超越一對一:以 DialogLab 編寫、模擬及測試動態人類與 AI 羣體對話

    Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。

2月5日週四
2月2日週一
1月28日週三
  1. Google Research58

    Google Research 探討智能體系統的規模化原理及有效條件

    Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。

1月27日週二
1月23日週五
1月21日週三
  1. Hugging Face Blog51

    AssetOpsBench 彌合 AI 智能體基準與工業實務的落差

    AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。

1月8日週四
12月23日週二
12月22日週一
12月19日週五
  1. Google Research52

    Google Research 回顧 2025 年研究突破與應用成果

    Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。

12月17日週三