Pi Codemode 是甚麼?它如何在 harness 端編排工具呼叫
Pi 的 Codemode 是讓 LLM 在 harness 端以 JavaScript 編排工具呼叫的機制,Pi 1.0 透過它加入 MCP 支援。它在 QuickJS 的 WASM runtime 沙盒中執行,沒有網絡、檔案系統或計時器,RAM 亦受限制,並可組合並行操作及把資料保留到同一 session 的後續呼叫。
Pi 的 Codemode 是讓 LLM 在 harness 端以 JavaScript 編排工具呼叫的機制,Pi 1.0 透過它加入 MCP 支援。它在 QuickJS 的 WASM runtime 沙盒中執行,沒有網絡、檔案系統或計時器,RAM 亦受限制,並可組合並行操作及把資料保留到同一 session 的後續呼叫。
Claude Code v2.1.292 新增插件市集安裝選項,並為 Agent 工具加入 effort 參數。
AWS 教程示範如何在航空應用程式中,以 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova 2.5 Sonic 建立語音旅遊禮賓服務。
AI Unified Process 以系統用例和領域模型作核心規格,讓 Agent 直接根據系統用例生成業務軟件,省略規劃與任務拆分階段。現代化項目先從舊系統逆向整理用例、實體模型、測試和文件,再交由業務人員審核,按行為生成新實作,而非直接轉換舊程式碼。生成流程配合技能、防護規則、架構指引、MCP 伺服器和測試,並按風險安排審查。
作者以 Codex、Figma MCP 和多智能體協作流程,將網站 5 個頁面近乎完美地複製到 Figma,耗時不到 5 分鐘。流程由主協調 Agent 為每個子 Agent 分配一頁,再審核結果並按需派發修正;作者先用 GPT-5.4-Medium 反覆調整指示,再以 GPT-5.3-Codex-Spark 執行。
Baseten 推出 Baseten Hosted Tools,首項工具 Baseten Grounded Inference 在 Baseten Inference Stack 內提供網頁搜尋,讓託管模型取得最新網頁資訊。
Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。
Cohere Labs 公開 Agentic Task Ecosystem(ATE)數據集,分析智能體工具對職業任務的自動化覆蓋。數據集收錄 696,291 項來自 123,069 個公開 MCP 伺服器的工具;按嚴格標準,僅 2.6% 能端到端執行已記錄的職業任務,923 個職業中有 419 個沒有任何智能體工具活動。
Prime Intellect 開源 General Agent 環境首個版本,並以合成器生成任務、按求解模型通過率逐級校準難度。語料目前包含 4,504 項任務、1,040 個領域及 8,159 種獨特工具。
Claude Marketplace 正式上線,整合插件與連接器、智能體與產品,以及服務合作夥伴,讓客戶可在同一平台尋找工具和服務。平台目前提供逾 2,000 個連接器及插件,客戶亦可用部分已承諾的 Anthropic 支出購買 Claude 驅動的軟件。開發者可運用 MCP 和智能體技能建立連接器或插件,產品商可申請上架,服務商則可加入 Claude Partner Network。
Liquid AI 以開源桌面智能體 LocalCowork 測試 LFM2-24B-A2B 在筆電本地執行工具調用的表現,模型、工具和資料均留在裝置上。在 Apple M4 Max、36 GB 統一記憶體的筆電上,工具選擇平均耗時約 385 ms、佔用約 14.5 GB 記憶體,單步準確率為 80%。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Replit 現已可直接在 Claude 中使用,用戶可將設計及一般開發任務交由 Replit 繼續建置、完善及發布。用戶可在 Claude Design 以自然語言設計應用程式,再透過官方 Replit Connector 傳送至 Replit,無須複製貼上或切換工作情境。
Cohere 的企業檢索平台 Compass 以雲端託管服務 Compass Cloud 形式進入私人測試。Cohere 將管理完整檢索流程及模型推理,開發者可透過 APIs、MCP server 或 Python SDK 使用。自行託管部署仍可供有私隱限制的項目使用,Cohere 正與有限數目的企業團隊合作測試。
Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。
Google Cloud 公佈 AlloyDB 面向 AI 智能體的資料庫架構,並開放 AlloyDB PostgreSQL for agents 預覽,主打隔離、亞毫秒儲存 I/O,以及按需求擴展至數千個節點。
Google Cloud 宣佈 Spanner Omni 正式推出,這個可自行部署的 Spanner 版本可在本地數據中心及其他雲端運行,並提供與全託管 Spanner 相同的核心能力。
Anthropic 為 Model Hardware Standard(MHS)啟動研究預覽,向首批科研實驗室及先進製造商提供讓 AI 智能體協調操作多種實體設備的共同規格。
Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。
Google 等五個組織在過去五個月承認 AI 智能體漏洞,攻擊者可利用目標網絡內一個智能體,向其他內部智能體傳播惡意指令。獨立研究員 Syed Anas Mohiuddin 測試多個機構的智能體,其概念驗證攻擊利用 MCP(Model Context Protocol)的信任缺口。這種提示詞注入針對特定智能體而非 LLM;MCP 是 AI 應用程式和智能體在內部網絡互通的一種標準。
Codex 0.160.1 修正遠端 stdio MCP 伺服器啟動時未能保留環境變數的問題。明確設定遠端環境變數時,SYSTEMROOT、TEMP 和 TMP 會予以保留,讓 Unix 主機保留 Windows executor 的啟動環境。
Amazon SageMaker AI 推出 aws-ai-ml 技能,讓支援 MCP 的編碼智能體協助最佳化生成式 AI 推理。它可測試現有端點、推薦部署配置、比較基準測試結果,並生成可檢視及執行的 SageMaker Python SDK v3 程式碼;測試報告提供實際基礎設施負載下的吞吐量、延遲和並行數據。
AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。
AWS 示範以部署在 Amazon Bedrock AgentCore 的 Quick Resource Migrator MCP 伺服器,自動化 Amazon Quick 資源的跨帳戶推廣。
cq 項目旨在為智能體建立可共享、可供審核的知識層,將解決問題所得整理成知識單元,供其他智能體日後檢索。cq 預設使用本地 SQLite 資料庫,知識經審核後可分享至團隊空間或公共知識庫。Joplin MCP 示例中,Claude 在一次配置排錯後提出知識單元,重試時再查詢並採用正確的設定路徑。
Claude Code 發佈 v2.1.288,新增多項功能,並修正工作階段恢復、權限檢查、插件及雲端工作流程等問題。新增功能包括按 Up 還原以 Ctrl+C 清除的提示詞草稿(包括貼上的文字和圖片)、以 --max-findings <n>|all 調整 /code-review 的回報數量,以及用 Ctrl+F 按名稱搜尋工作階段。
MultiOn 與 LlamaIndex 的整合示例展示如何以 AI 智能體自動處理網上任務及電郵流程。示例以 OpenAIAgent 結合瀏覽器與 Gmail 搜尋工具,搜尋、摘要及開啟郵件,再根據郵件串起草回覆。
LlamaIndex 將 Agentic Document Workflow(ADW)作為企業文件流程的參考架構,以 Parse、Retrieve、Reason、Act 四階段把文件處理連接至業務動作,目標是超越「與文件聊天」原型。
LlamaIndex 電子報彙整本週的新整合、平台更新,以及參與 Databricks Data + AI Summit 的心得。CleanlabAI 可為每個 LLM 回應評分信任度,並即時捕捉幻覺或錯誤回應;LlamaParse 則推出針對特定用途的解析代理,並更新穩定性。
MCP 不會取代向量搜尋:聯邦式 MCP 可讓智能體直接查詢結構化資料,但跨來源排序、延遲和供應商搜尋品質仍有限。企業資料中有 90% 是缺乏原生查詢 API 的 PDF、PPT、掃描檔和試算表,仍須經解析、抽取、分塊及索引;集中式檢索層則可快速查找語義相關內容。
LlamaIndex 教程示範透過 Bright Data 工具為 LlamaIndex 的 AI 智能體接入網頁資料,支援按需取得更新資訊。範例以 `BrightDataToolSpec` 和 `FunctionAgent` 配置工具,展示網頁抓取、搜尋、結構化資料讀取及截圖,並提供完整 Python 程式碼。
LlamaIndex 介紹為 Claude Code 加入文件理解能力的三種做法,涵蓋 MCP 文件檢索、CLI 文件操作,以及以 CLAUDE.md 指引工作流建置。
LlamaIndex 為文件推出原生 MCP 搜尋,讓編碼智能體和智能體工作流可直接搜尋全部文件。服務網址為 https://developers.llamaindex.ai/mcp,提供 search_docs(BM25 詞彙搜尋)、grep_docs(正則搜尋)及 read_doc(讀取指定頁面的完整內容)三種工具。BM25 索引在建置時靜態生成,準確度略低於向量搜尋,但維護較輕量。
LlamaIndex 本期電子報宣佈,LlamaClassify TypeScript SDK 現已提供,文件亦整合原生 MCP 搜尋。該搜尋讓編碼智能體可直接使用詞彙搜尋、regex 搜尋及完整頁面內容;另有以 Claude Code 和 vibe-llama 建立金融文件分類智能體工作流程並部署至雲端的示範。
LlamaIndex 示範如何結合 AgentFS、LlamaParse、Claude Agent SDK 和 LlamaIndex Workflows,為 Claude Code 建立受控的檔案存取環境。
LlamaIndex 指出,智能體正以檔案及檔案系統管理長期對話、檢索外部上下文和載入技能,並將其視為重要的上下文介面。作者稱,實驗中配備檔案系統工具和語義搜尋的推理智能體可動態檢索上下文,而單靠檔案搜尋在中小型文件集合上亦勝過 naive semantic search(不計延遲)。
LlamaIndex 比較了智能體使用技能與 MCP 工具的取捨,指出 MCP 適合輸入輸出明確、要求可預測執行的操作,技能則適合以自然語言提供行為指引。MCP 以固定 schema 的 API 呼叫執行,但通常需要一定開發知識並帶來網絡延遲;技能以本地檔案提供指示,設定較輕,卻可能因 LLM 解讀而產生誤判或幻覺。
LlamaIndex 本期電子報彙整產品、競賽與合作更新,包括 LlamaExtract 新增引用邊界框、推出 LobsterX,以及 Skills 與 MCP 工具選用指南。
LlamaIndex 重構 LlamaParse Platform MCP,將重心由儲存與檢索轉向由 Parse、Classify 和 Split 服務支援的文件處理。
LlamaIndex 擴展 LlamaParse MCP,加入 Extract 服務整合、Index v2 的智能體知識存取,以及按產品劃分的專用 MCP 端點。