跳到正文

#MCP/工具調用

今日 3 條
今天10月7日週三
10月6日週二
  1. Tessl:產品與工程博客57

    規格驅動開發在以系統用例作規格時奏效

    AI Unified Process 以系統用例和領域模型作核心規格,讓 Agent 直接根據系統用例生成業務軟件,省略規劃與任務拆分階段。現代化項目先從舊系統逆向整理用例、實體模型、測試和文件,再交由業務人員審核,按行為生成新實作,而非直接轉換舊程式碼。生成流程配合技能、防護規則、架構指引、MCP 伺服器和測試,並按風險安排審查。

  2. Eugene Yan:Writing73

    如何與 AI 協作,讓工作成果持續累積

    Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。

  3. Cohere 產品與研究博客65

    Cohere Labs 分析 ATE 數據集:696,291 項 MCP 工具中,僅 2.6% 可端到端執行已記錄職業任務

    Cohere Labs 公開 Agentic Task Ecosystem(ATE)數據集,分析智能體工具對職業任務的自動化覆蓋。數據集收錄 696,291 項來自 123,069 個公開 MCP 伺服器的工具;按嚴格標準,僅 2.6% 能端到端執行已記錄的職業任務,923 個職業中有 419 個沒有任何智能體工具活動。

  4. Claude:Blog68

    Claude Marketplace 上線,集中展示插件、智能體、產品及合作夥伴服務

    Claude Marketplace 正式上線,整合插件與連接器、智能體與產品,以及服務合作夥伴,讓客戶可在同一平台尋找工具和服務。平台目前提供逾 2,000 個連接器及插件,客戶亦可用部分已承諾的 Anthropic 支出購買 Claude 驅動的軟件。開發者可運用 MCP 和智能體技能建立連接器或插件,產品商可申請上架,服務商則可加入 Claude Partner Network。

  5. Claude:Blog63

    Claude 推出插件目錄提交入口,支援審核追蹤及上線後使用分析

    Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。

  6. Cerebras:Blog53

    Cerebras 教 AI 智能體以自然語言測試 Cloud Console

    Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。

  7. Ars Technica · AI65

    Google 等機構的 AI 智能體漏洞暴露 MCP 結構性缺陷

    Google 等五個組織在過去五個月承認 AI 智能體漏洞,攻擊者可利用目標網絡內一個智能體,向其他內部智能體傳播惡意指令。獨立研究員 Syed Anas Mohiuddin 測試多個機構的智能體,其概念驗證攻擊利用 MCP(Model Context Protocol)的信任缺口。這種提示詞注入針對特定智能體而非 LLM;MCP 是 AI 應用程式和智能體在內部網絡互通的一種標準。

  8. AWS Machine Learning Blog55

    Amazon SageMaker AI 推出 aws-ai-ml 技能,為編碼智能體提供生成式 AI 推理最佳化能力

    Amazon SageMaker AI 推出 aws-ai-ml 技能,讓支援 MCP 的編碼智能體協助最佳化生成式 AI 推理。它可測試現有端點、推薦部署配置、比較基準測試結果,並生成可檢視及執行的 SageMaker Python SDK v3 程式碼;測試報告提供實際基礎設施負載下的吞吐量、延遲和並行數據。

  9. AWS Machine Learning Blog55

    Amazon Bedrock AgentCore Evaluations 教學:評估多智能體系統的可解釋性與有用性

    AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。

10月5日週一
  1. Tessl:產品與工程博客54

    智能體需要一個共享所學的公共知識庫

    cq 項目旨在為智能體建立可共享、可供審核的知識層,將解決問題所得整理成知識單元,供其他智能體日後檢索。cq 預設使用本地 SQLite 資料庫,知識經審核後可分享至團隊空間或公共知識庫。Joplin MCP 示例中,Claude 在一次配置排錯後提出知識單元,重試時再查詢並採用正確的設定路徑。

10月3日週六
  1. Claude Code:GitHub Releases51

    Claude Code 發佈 v2.1.288,新增多項功能並修正多項問題

    Claude Code 發佈 v2.1.288,新增多項功能,並修正工作階段恢復、權限檢查、插件及雲端工作流程等問題。新增功能包括按 Up 還原以 Ctrl+C 清除的提示詞草稿(包括貼上的文字和圖片)、以 --max-findings <n>|all 調整 /code-review 的回報數量,以及用 Ctrl+F 按名稱搜尋工作階段。

  2. LlamaIndex:產品、工程與評測41

    LlamaIndex 電子報:2025-06-17

    LlamaIndex 電子報彙整本週的新整合、平台更新,以及參與 Databricks Data + AI Summit 的心得。CleanlabAI 可為每個 LLM 回應評分信任度,並即時捕捉幻覺或錯誤回應;LlamaParse 則推出針對特定用途的解析代理,並更新穩定性。

  3. LlamaIndex:產品、工程與評測43

    MCP 會淘汰向量搜尋嗎?

    MCP 不會取代向量搜尋:聯邦式 MCP 可讓智能體直接查詢結構化資料,但跨來源排序、延遲和供應商搜尋品質仍有限。企業資料中有 90% 是缺乏原生查詢 API 的 PDF、PPT、掃描檔和試算表,仍須經解析、抽取、分塊及索引;集中式檢索層則可快速查找語義相關內容。

  4. LlamaIndex:產品、工程與評測55

    LlamaIndex 文件推出原生 MCP 搜尋,提供三種工具

    LlamaIndex 為文件推出原生 MCP 搜尋,讓編碼智能體和智能體工作流可直接搜尋全部文件。服務網址為 https://developers.llamaindex.ai/mcp,提供 search_docs(BM25 詞彙搜尋)、grep_docs(正則搜尋)及 read_doc(讀取指定頁面的完整內容)三種工具。BM25 索引在建置時靜態生成,準確度略低於向量搜尋,但維護較輕量。

  5. LlamaIndex:產品、工程與評測42

    LlamaIndex 電子報 2025-11-04

    LlamaIndex 本期電子報宣佈,LlamaClassify TypeScript SDK 現已提供,文件亦整合原生 MCP 搜尋。該搜尋讓編碼智能體可直接使用詞彙搜尋、regex 搜尋及完整頁面內容;另有以 Claude Code 和 vibe-llama 建立金融文件分類智能體工作流程並部署至雲端的示範。

  6. LlamaIndex:產品、工程與評測53

    LlamaIndex 指出檔案系統正成為智能體管理上下文的核心介面

    LlamaIndex 指出,智能體正以檔案及檔案系統管理長期對話、檢索外部上下文和載入技能,並將其視為重要的上下文介面。作者稱,實驗中配備檔案系統工具和語義搜尋的推理智能體可動態檢索上下文,而單靠檔案搜尋在中小型文件集合上亦勝過 naive semantic search(不計延遲)。

  7. LlamaIndex:產品、工程與評測53

    智能體何時該用技能、何時該用 MCP 工具?LlamaIndex 比較兩者適用情境

    LlamaIndex 比較了智能體使用技能與 MCP 工具的取捨,指出 MCP 適合輸入輸出明確、要求可預測執行的操作,技能則適合以自然語言提供行為指引。MCP 以固定 schema 的 API 呼叫執行,但通常需要一定開發知識並帶來網絡延遲;技能以本地檔案提供指示,設定較輕,卻可能因 LLM 解讀而產生誤判或幻覺。