跳到正文

Agent 智能體

讓模型自主規劃、調用工具、完成多步任務的技術方向——從 Claude Code、Manus 到各家 Agent 框架與評測基準的全部動態。

最新精選

第 21–40 條 · 共 137 條
9月29日週二
9月28日週一
  1. Anthropic:Claude.dev 開發者博客80

    Claude Sonnet 5.5 開發指南:API 接入、遷移與調校

    Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。

    推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。

  2. Hugging Face Blog70

    Holo4 發佈通用電腦操作智能體模型系列

    H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。

    推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。

9月26日週六
  1. GitHub Blog · AI & ML66

    GitHub Copilot app 初學者指南:如何用 canvases 建立自訂工作流程

    GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。

    推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。

9月23日週三
  1. Latent Space83

    Anthropic 發佈 Claude Opus 5.5 並成為 AINews 預設模型,OpenAI 推出降價版 GPT-6 Sol 與 GPT-6 Luna

    Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。

    推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。

9月22日週二
9月16日週三
9月10日週四
  1. Cursor Blog79

    Cursor 推出 Projects,支援長週期多智能體工作

    Cursor 推出 Projects,現正以 beta 階段逐步向所有用户開放,讓協調智能體承接跨月工作並委派子智能體。Projects 預設在雲端運行,需要時可切換至本地,並透過共享上下文及監聽 Slack 頻道、按計劃運行或跟進 PR 來主動處理工作。Cursor 表示,新用户合併 PR 數量提升 30%,而主要使用 Projects 的用户合併量達原來六倍。

    推薦理由:Projects 將長週期工作的上下文累積、智能體委派和事件觸發整合起來,文中亦提供新用户與主要使用者的 PR 合併量數據。

  2. OpenAI News63

    OpenAI 推出 Agents API,供建置及啟動雲端智能體

    OpenAI 推出 Agents API,這項由 Codex harness 驅動的託管服務可用於建置及啟動雲端智能體。服務支援編排、長時段工作階段與工具使用。詳情見 https://openai.com/index/introducing-the-agents-api。

    推薦理由:這則公告交代 Agents API 將編排、長時段工作階段與工具使用納入雲端智能體託管服務,清楚界定其運作範圍。

9月9日週三
9月5日週六
  1. GitHub Blog · AI & ML67

    Project HydraFusion 以多模型編排提供前沿級品質

    GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。

    推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。

9月3日週四
  1. Hugging Face Blog73

    Hugging Face 推出開源工具 funes,為編碼智能體提供可檢索的持久記憶

    Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。

    推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。

  2. Google DeepMind60

    Google DeepMind 推出 Fairwind Program,向政府機構及可信賴夥伴有限度開放 AI 網絡防禦能力

    Google DeepMind 推出有限度開放的 Fairwind Program,讓政府機構及可信賴夥伴使用進階 AI 網絡防禦能力。計劃把 Gemini 3.8 Flash Cyber 與 CodeMender 結合,用於自主發現、驗證及修復漏洞,並可在機構安全雲端環境內於數分鐘生成經驗證、可部署的修補程式。

    推薦理由:Fairwind 將 Gemini 3.8 Flash Cyber 與 CodeMender 結合,讓參與機構在安全雲端環境內生成經驗證、可部署的漏洞修補程式,將人工修補由數週縮至數分鐘。

9月2日週三
8月25日週二
  1. Hugging Face Blog62

    Granite 4.2 大語言模型如何構建

    IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。

    推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。

8月21日週五
  1. Hugging Face Blog63

    Hugging Face Inference Endpoints、Jobs 和 Buckets 如何支撐 Papers with Code 搜尋

    Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。

    推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。

8月20日週四
  1. Mistral AI68

    Mistral 推出 Agentic Search,以多步檢索提升準確率並降低延遲和 token 使用量

    Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。

    推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。

8月14日週五