Torch Spyre 如何整合 PyTorch CRCR 並驗證上游變更
Torch Spyre 透過智能體測試選擇流程、宣告式 YAML 測試重用框架及可靠工作流程,完成 PyTorch CRCR 的 L2 整合。測試選擇流程根據程式碼和實際執行結果篩選及分類測試;從 PyTorch 2.13 升級至 2.14 時,只需評估約 4000 項變更測試,而非數萬項。
Torch Spyre 透過智能體測試選擇流程、宣告式 YAML 測試重用框架及可靠工作流程,完成 PyTorch CRCR 的 L2 整合。測試選擇流程根據程式碼和實際執行結果篩選及分類測試;從 PyTorch 2.13 升級至 2.14 時,只需評估約 4000 項變更測試,而非數萬項。
NVIDIA TensorRT Model Connect 是一個面向編碼智能體設計、基於 NVIDIA TensorRT 建構的開源 C++ AI 模型參考實作集合。其開發經驗包括並行工作、模型家族隔離、可逆變更,以及 GPU 支援的驗證。
文章展示如何在 AlloyDB for PostgreSQL 中整合 TypeSafe AI 的 Jev 模型,直接對資料庫資料執行語義篩選與分類。作者以 PostgreSQL 陣列批次處理 50 筆商品,將多項模型評估合併成一次 HTTP 請求;測試耗時約 180 毫秒,逐行使用 Jev 約需 5,600 毫秒,預設模型約需 19,500 毫秒。
AWS 介紹 Amazon Quick 的提示詞工程基礎,整理適用於不同功能的通用原則與可複用框架。文章涵蓋明確具體、提供業務背景、以示例指定輸出,以及 CRISPE、RADAR、ARCHITECT 和 QUEST 等框架,並介紹中繼資料檢索、多角度分析與情境規劃。文中以 RFI 問卷自動化示範 Quick Flow 如何把多工作表資料整理為四欄 CSV,並稱可將原需數小時的處理縮至數分鐘。
Sebastian Raschka 梳理文本分類由詞袋模型、RNN/CNN 到 Transformer 的演進,並介紹 Jev 的分類 API 及其多任務表現。
vLLM 的拆分式服務指南説明如何將大語言模型(LLM)推理中的 prefill、decode 和 CPU 前端工作分開部署,並提供 v0.30.0 或更新版本的操作示例。
Gemini Live API 可用於建立即時語音 AI 智能體,透過雙向 WebSocket 同時傳送和接收音訊,支援即時回應及用戶插話。建議並行處理麥克風上行音訊與模型下行語音,並在麥克風偵測到用戶説話時立即靜音及清除播放緩衝區;Gemini Live 內置 VAD 負責偵測語音活動。工具操作可非同步執行並即時回傳確認,避免較慢的外部操作令語音生成停頓。
文章提出 7 種在生產環境加固 AI 智能體沙盒的方法,並指出標準 Docker 容器共用主機作業系統核心。建議採用 gVisor 或 microVM 作核心隔離,把 API 金鑰留在沙盒外並透過閘道呼叫,預設限制所有階段的外連,並按整個工作階段累計工具操作及預算。其餘措施包括隔離工作區並保護 CI/測試檔案、使用按活躍 CPU 計費的無伺服器環境,以及把審計日誌即時傳送至沙盒外。
GitHub Security Lab 使用開源 AI 安全 Agent 審計 Android 應用程式,至今已找出並回報 24 個漏洞。作者透過區分流動與非流動入口、按入口類型指定漏洞檢查,並結合嚴格與廣泛提示進行多輪審計。
Anthropic 為 Claude Code 的 claude-api skill 加入 `/claude-api build-eval` 和 `/claude-api hillclimb`,分別引導建立評測及逐輪優化應用。
GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。
推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。
GitHub 逐步將 Primer 元件及 dotcom 的樣式由 CSS-in-JS 遷移至 CSS Modules,並於 2026 年 6 月完成整體遷移。
作者測試 Claude Code 的 effort 等級後指出,較高 effort 會增加模型自主判斷、驗證和邊界案例測試,對需要嚴密驗證的工作尤其有用。Fable 5.1 在 Terminal-Bench 3.0 的安全類通過率由 low effort 組的 64% 升至 top effort 組的 87%,硬件類則由 34% 升至 75%。
Shadow roots 透過互動範例解説 shadow DOM,展示樣式封裝、繼承、slots、parts 及 JavaScript 存取方式。它們會建立隔離的 DOM 樹,包含私有樣式表與元素,並以特定且受控的方式與頁面 DOM 互動。
Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。
這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。
Trail of Bits 為審計 Miden VM,先花六個月以 AI 智能體從零建置工具,再在審計中發現安全漏洞。工具包括 LSP 伺服器、反編譯器、靜態分析引擎及 VM 執行器的 Lean 模型;分析找出逾 400 處可改善類型驗證的位置,並發現一項可讓惡意證明者偽造 Falcon 簽章、盜取由 Falcon 金鑰對控制的 Miden 帳戶資金的高危漏洞。
Microsoft 根據自身數百項 AI 轉型實踐,總結出五項經驗,涵蓋以業務成果為先、重設端到端流程及讓員工參與等做法。文中舉例,銷售團隊成交率提高 20%,部分供應鏈工作流程週期縮短最多 75%,而一支 9 人工程團隊在 35 天內交付初始產品版本。Microsoft Frontier Playbook 整理了數百項轉型實踐,提供按職位、工作流程或全新業務機會調整的實踐模式。
Together AI 分享由閉源模型轉向開源模型的遷移流程,涵蓋候選模型篩選、評測、調整、決策和投產。文章建議以真實流量評估準確度、效能及成本,並逐項調整提示詞、推理設定、工具環境或模型權重。Together AI 表示,部分客戶轉用開源模型後成本減幅可達 70%;投產時可先以 10% 流量進行金絲雀部署。
Ai2 與華盛頓大學透過 GenAI for Science: Ai2–UW Materials Challenge,讓學生使用 AI 智能體 AutoDiscovery 探索數據、提出科研假設並核驗結果。
呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。
ATV Big Air Tour 藉助 ChatGPT,將原需 3 天的工作縮短至 3 小時。團隊使用 ChatGPT Work 加快市場推廣、商品營運等工作,並在 15 分鐘內將商品照片轉成庫存網站。
Sierra 的企業級 Voice AI 指南説明,AI 語音智能體可結合客戶背景及業務系統,在通話中處理要求並完成工作。企業準備程度須以整通電話作端到端評估,涵蓋延遲、輪流發言、語音辨識、上下文、操作、護欄及轉接七項測試,並納入噪音、打斷、模糊請求和整合失敗等情況。Sierra 的 tau-voice 基準以 278 項客戶服務任務,結合真實音訊及重疊發言,測試對話行為與資料庫狀態是否正確。
loveholidays 使用 OpenAI Codex,讓公司各團隊更容易參與軟件開發。這有助團隊更快把想法轉化為產品。
Anthropic 計劃為 Claude 模型生成的文字加入浮水印,Sebastian Raschka 詳解其文字生成與抽樣機制。浮水印在抽樣階段使用秘密金鑰和前四個詞語控制 token 選擇,毋須重新訓練模型;tournament sampling 讓系統可用金鑰和浮水印函數為文字評分,毋須重新執行 LLM。由於浮水印位置不公開,作者指出需改動多處文字才可能移除標記。
Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。
推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支援 ColBERT 式多向量檢索。文中示範載入 PyLate 與 Stanford-NLP ColBERT checkpoint、接入檢索索引,以及以同一 API 執行 ColPali 視覺文件檢索。
推薦理由:文章對照 LateOn 與 DenseOn 在 NanoBEIR 13 個資料集的結果,並以索引體積數據呈現多向量檢索表現與儲存成本的取捨。
這個教學示範如何從零建構 AI 文字偵測器,並以微調 DistilBERT 分類器估算文字由 AI 生成的可能性。評分為 0-100,項目目標包括提供人類及智能體可用的 API,以及可顯示全文和個別文字區塊評分的本地瀏覽器介面。作者亦以此探討 AI 偵測器的限制,以及評分器或驗證器在 LLM 應用中的用途。
OpenAI 的 GPT-5.6 建構指南聚焦初創公司如何運用 GPT-5.6,更快、更具成本效益地構建 AI 智能體。指南亦涵蓋更智能的模型選擇,以及 Responses API 的新能力。
Hamel Husain 列出其 AI 產品工程長文選集,題材包括 AI 評測、產品開發、LLM 評估及工程工具。他與人共同教授的 AI Evals for Engineers and PMs 已有逾 5,000 名學生,來自 500 多間公司,包括 OpenAI、Anthropic 和 Google。
OpenAI CFO Sarah Friar 分享打造 AI 原生財務職能的五點啟示,內容涵蓋自動化預測、加強控制與 AI 投資回報。這些經驗聚焦財務職能的 AI 原生建構。
Zapier 的企業市場推廣團隊使用 ChatGPT Work 改造核心流程,以減少潛在客户漏斗中的流失。團隊亦用它製作宣傳活動素材並自動化報告。
HSP GRUPPE 使用 ChatGPT Enterprise 提升生產力和工作質素,並為税務諮詢及客户服務創造更多容量。
OpenAI 用六個月構建 GPT-Live 即時語音系統,支援與 AI 持續進行語音互動。系統採用無需輪次切換的語音模型和低延遲架構,以實現更快、更自然的對話。
Cursor 分享了為雲端智能體搭建開發環境的方法,讓雲端 VM 貼近本地開發,並支援智能體測試程式碼及維護環境。團隊以 Dockerfile 配置依賴,以 anydev 簡化服務啟動,並透過 Cursor Cloud MCP 和 Cloud Doctor 診斷、修復環境及改善工作流。去年 12 月,合併到 Cursor 單體倉庫的 PR 中約十分之一由雲端智能體編寫,如今已超過一半。
科學家正運用 AI 編碼智能體推動科學計算現代化,加快基因組學及其他領域的軟件開發與發現。
Thariq Shihipar 分享 Claude 5 世代模型的上下文工程新規則,主張減少限制並按需載入指引。Anthropic 團隊為 Claude Opus 5 和 Claude Fable 5 將 Claude Code 的系統提示詞削減逾 80%,編碼評測未見可測量的表現下降。
Ethan Mollick 建議按任務風險和工作類型選用 AI,並以 ChatGPT 或 Claude 的智能體處理實際工作。低風險問答可用合適的免費模型;高風險議題則建議選 Claude 的 Opus 或 Fable,或將 ChatGPT 的 GPT-5.6 Sol 設為至少「High」思考級別。
Sebastian Raschka 以 GPT-5.6 系列為切入點,解説大語言模型如何在訓練及推理階段支援不同推理力度;該系列有三種模型規模,每種約有五至六種推理力度設定。
OpenAI 的創意團隊運用 Codex 和上下文感知 AI 建構自訂創意工具、加快構思,並更快製作原型。