AI 原生設計:構建 NVIDIA TensorRT Model Connect 的經驗
NVIDIA TensorRT Model Connect 是一個面向編碼智能體設計、基於 NVIDIA TensorRT 建構的開源 C++ AI 模型參考實作集合。其開發經驗包括並行工作、模型家族隔離、可逆變更,以及 GPU 支援的驗證。
NVIDIA TensorRT Model Connect 是一個面向編碼智能體設計、基於 NVIDIA TensorRT 建構的開源 C++ AI 模型參考實作集合。其開發經驗包括並行工作、模型家族隔離、可逆變更,以及 GPU 支援的驗證。
文章展示如何在 AlloyDB for PostgreSQL 中整合 TypeSafe AI 的 Jev 模型,直接對資料庫資料執行語義篩選與分類。作者以 PostgreSQL 陣列批次處理 50 筆商品,將多項模型評估合併成一次 HTTP 請求;測試耗時約 180 毫秒,逐行使用 Jev 約需 5,600 毫秒,預設模型約需 19,500 毫秒。
Microsoft 在 European Microsoft Fabric + SQL Community Conference 宣佈 Microsoft Fabric 與 Azure Databases 多項更新,讓企業能以受治理的業務數據和上下文支援 AI。
OpenClaw 宣佈 OpenClaw Enterprise(OCE),這是一個開源、供應商中立的平台,用於在敏感環境管理持續運行的智能體。平台提供多租戶、硬性安全邊界、全生命週期治理與審計能力,並支援替換 harness、模型和沙箱等核心組件。
vLLM 的拆分式服務指南説明如何將大語言模型(LLM)推理中的 prefill、decode 和 CPU 前端工作分開部署,並提供 v0.30.0 或更新版本的操作示例。
文章提出 7 種在生產環境加固 AI 智能體沙盒的方法,並指出標準 Docker 容器共用主機作業系統核心。建議採用 gVisor 或 microVM 作核心隔離,把 API 金鑰留在沙盒外並透過閘道呼叫,預設限制所有階段的外連,並按整個工作階段累計工具操作及預算。其餘措施包括隔離工作區並保護 CI/測試檔案、使用按活躍 CPU 計費的無伺服器環境,以及把審計日誌即時傳送至沙盒外。
Import AI 第 474 期聚焦柏拉圖式心智假説、Google 籌備將 TPU 送入太空及智譜以 GLM-5.3 加速自身推理基建。機械人研究者指出,領域仍欠缺可擴展的通用後訓練配方;他們介紹的 EXPO(-FT) 仍在早期發展,未廣泛使用。
Claude Code 發佈 v2.1.283,新增模型可用性管控、提示詞審核及閘道負載測試模式,並修正多項 MCP、插件與工作流問題。管理設定可限制可用模型版本或封鎖指定模型;/doctor prompt-audit 可檢查 CLAUDE.md、skills、agents 和 commands 中為舊模型編寫的提示詞模式。負載測試模式會建立並簽署請求,但不會發送至上游,客戶端則會收到固定回覆。
GitHub 逐步將 Primer 元件及 dotcom 的樣式由 CSS-in-JS 遷移至 CSS Modules,並於 2026 年 6 月完成整體遷移。
Microsoft 宣佈 Physical AI Toolchain 新增機械人推理卸載功能,支援透過 Kubernetes 工具把 AI 工作負載分配至機械人、邊緣 GPU 和雲端。
推薦理由:文章將實機工作負載的效能、電池續航與算力配置放在同一脈絡比較,並介紹以 Kubernetes 分配推理的工具,呈現卸載方案的收益與代價。
Anthropic 在 8 月以兩週衝刺,將 claude.ai 和 Claude 桌面應用程式的核心用戶體驗整體加快至原來約 3 倍。
推薦理由:這次衝刺展示了以可重複基準、CI 效能門檻和分階段上線構成優化閉環的方法,並由工程師把關改動風險與用戶體驗。
Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。
GPT-6 改進提示詞快取,提升快取命中率,並加入新診斷功能、明確斷點,以及可降低延遲和成本的控制項。
《The Pragmatic Engineer》訪問 Microsoft Windows 團隊,分析 Windows 在作業系統層整合 AI 智能體與本地模型的計劃。
Simon Willison 開發 llm-typesafe 0.1a0 插件,為 LLM 加入 TypeSafe AI 新 Jev 模型的支援。Jev 可處理是非型「noul」問題、選擇題及評分題;安裝指令為 `llm install llm-typesafe`,並須以 `llm keys set typesafe` 設定 API key。
vllm-metal 把 vLLM 的排程器、分頁 KV cache 和 OpenAI 相容伺服器帶到 Apple Silicon,並以 MLX 和 Metal 執行模型。
OpenClaw 正加入可選的決策模型支援,讓平台支援的功能及插件使用另行設定的模型,且不會取代對話模型。Plugin SDK 提供共用 API `api.runtime.decisions.evaluate`;TypeSafe adapter 支援託管版 Jev 及本地 System One 伺服器,例如 Kev。
Together AI 介紹端點 Rollouts 功能,讓用戶以 canary、blue-green 或 rolling 策略,將生產流量由來源部署切換至目標部署。
Hugging Face 為 Transformers 加入 GGUF 支援,讓用户可透過熟悉的 Transformers API 在本機載入量化檢查點並生成內容。
推薦理由:文章示範透過 Transformers API 從 Hub 載入 GGUF 量化檢查點,並以 Q4_K_M 等選項説明檔案大小與精度的取捨。
vLLM 整合 PyNvVideoCodec,支援使用 NVIDIA GPU 解碼影片,將影片解碼工作從 CPU 移走,以擴展多 GPU 影片字幕生成吞吐量。在 8 張 H100 的測試中,GPU 解碼吞吐量比 CPU 解碼高逾一倍,且大型負載的 CPU 瓶頸消除。PyNvVideoCodec 已包含於標準 CUDA 版 vLLM;自訂安裝需加入 PyNvVideoCodec==2.0.4。
OpenClaw 推出原子更新機制,準備更新時會維持現有 gateway 運作,更新失敗則回復至上一個可用設定,並保留可協助診斷問題的 Agent。同時,OpenClaw 推出更新問題回報按鈕。Jason Sy 表示新流程在不少情況下有效,但尚未稱更新問題已完全解決。
Together AI 分享由閉源模型轉向開源模型的遷移流程,涵蓋候選模型篩選、評測、調整、決策和投產。文章建議以真實流量評估準確度、效能及成本,並逐項調整提示詞、推理設定、工具環境或模型權重。Together AI 表示,部分客戶轉用開源模型後成本減幅可達 70%;投產時可先以 10% 流量進行金絲雀部署。
Epoch AI 將 AI Data Centers explorer 擴至 86 個數據中心,估計涵蓋全球 AI 算力的 44%,並重新設計頁面。各站點資料包括以 H100-equivalents 計的算力容量、晶片類型、資本成本、建設狀態及衞星影像。
OpenAI 圍繞 Codex 運作智能體軟件工廠,讓智能體參與編碼、測試、審查、部署及生產監控。Perf Factory 會整理告警與儀錶板、識別延遲回退並提出修復建議,部署智能體亦會監測變更相關訊號。Codex 帶來的程式碼增量令部分建置、測試及部署系統在約 6 個月內負荷增至約 10 倍,團隊因此重新思考 PR 和程式碼審查流程。
MIT 研究人員開發 HardFlow,讓生成式 AI 在安全關鍵任務中滿足硬性約束,並找到較現有方法更優質的解決方案。它只在最終輸出施加約束,可於部署時套用至預訓練生成模型,無需重新訓練。在機械人操作、迷宮導航及文字指引圖像編輯測試中,HardFlow 完全滿足約束,運算時間與多數競爭方法相若或更低。
MIT 衍生公司 Atlas Building Composites 開發 AI 驅動的機械人製造平台,將一次性塑膠轉化為耐用建築材料。平台結合無水塑膠回收與大型複合材料增材製造,生產地基、露台及牆、地板和屋頂用桁架;公司最近向 U.S. Army Corps of Engineers 供應美國製再生複合材料桁架,用於麻省濕地一座 40-foot 橋樑。
inclusionAI 發佈 SingProbe 串流護欄探針,以 Qwen/Qwen3.5-397B-A17B 的生成隱藏狀態逐 token 評估意圖、安全性及幻覺風險。
inclusionAI 發佈 SingProbe,這是一款基於 Qwen/Qwen3.5-27B 的逐 token 串流防護探針,可評分查詢意圖、回應不安全性及幻覺風險。
inclusionAI 發佈 SingProbe 串流安全探針,基於 Qwen/Qwen3-4B-Instruct-2507 逐 token 評估查詢意圖、回應不安全性及幻覺風險。
inclusionAI 發佈 Hy3-singprobe,這款基於 tencent/Hy3 隱藏狀態的串流防護探針可逐 token 評分查詢意圖、回應安全性及幻覺風險。
inclusionAI 發佈 SingProbe 串流安全探針,重用 openai/gpt-oss-20b 生成時的隱藏狀態,逐 token 評估查詢意圖、回應不安全性及幻覺風險。
inclusionAI 發佈基於 google/gemma-4-31B-it 的 SingProbe 串流護欄。它復用基座模型生成時的隱藏狀態,逐 token 評估查詢意圖、回應安全性和幻覺風險,無需另跑安全模型。
Mistral 與 Cloudera 建立合作,將 Mistral 模型整合至 Cloudera 混合數據平台,讓企業可在自有環境部署推理,並以專有數據訓練自訂模型。模型可部署於私有及公有雲、本地端及完全隔離環境,企業亦可保有數據與所生成智能的控制權。模型可按企業需求調整並基於開放權重持有,訓練和推理可在客户選定的基礎設施及司法管轄區內進行。
Together AI 推出 Together GPU Clusters 可搶佔運算公開預覽,適用於所有地區的 Kubernetes 叢集,固定按隨需費率 50% 計費。
Mistral 宣佈完成 €3 billion D 輪融資,投後估值超過 €21 billion,並將藉此擴大前沿研究、訓練算力及基礎設施。本輪由 Samsung Electronics 領投,Scaleup Europe Fund(由 EQT 管理)與現有投資者 PSG Equity 共同領投;Mistral 稱這是歐洲科技公司完成過的最大股權融資。
推薦理由:融資不只用於前沿研究和訓練算力,也涵蓋基礎設施與商業拓展,呈現 Mistral 主權 AI 全棧路線的擴張重點。
呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。
Benedict Evans 指出,AI 不會令企業軟件大規模消失,而會擴展現有應用、催生新的垂直應用,並改變企業選擇不同工具的門檻。他將企業軟件使用概括為「制度化」與「即興」兩端,指出流程反覆出現、涉及多人並承載收入或風險時,便需要納入具審計、安全、維護和問責機制的系統。因此,企業採用 AI 不只是向員工提供模型,還要評估部署方式、營運流程變化,以及對業務經濟效益和競爭格局的影響。
OpenClaw 推出 macOS 安裝程式,並簡化配備 NVIDIA RTX 的 Windows 電腦本地模型設定。macOS 版可偵測並驗證既有 AI 連線;Windows 版可在引導期間偵測 NVIDIA RTX GPU,並為記憶體至少 24GB 的 GPU 建議經硬件調校的本地模型,足以在本機運行 30B 級模型。
Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。
推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。
Cursor 推出自託管機器功能,讓雲端智能體的工具執行可轉移至團隊自有網絡內的機器,而智能體的推理與規劃仍由 Cursor 雲端負責。團隊可用單機或資源池接入自有基礎設施,資源池會按排隊請求自動擴縮,並可透過快照讓閒置機器休眠及恢復。