重新思考 GPT-6 Astra 的技能與提示詞
OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。
OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。
OpenAI 的 GPT-6 系列模型指南説明初創企業如何選擇 GPT-6 模型、調整推理力度,並準備投入生產的工作流程。指南亦涵蓋改善提示詞與技能,以及協調工具。
AWS 介紹並部署 Adjudicated Query 模式,讓 Amazon Quick 的自然語言合規查詢透過固定 MCP 操作交由確定性規則引擎判定,而非由模型作出決策。
推薦理由:文章把自然語言查詢與合規判定分開,並以完整性收據和逐筆證據鏈展示如何核對大量檢查結果。
AWS 説明如何透過 Amazon Bedrock AgentCore Gateway,將受 JWT 驗證的 Web Search 接入 Claude Desktop on Amazon Bedrock。
AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。
OpenRouter 的指南介紹客服機械人採用低成本優先模型路由的方法,讓較小、成本較低的模型處理常見問題,並把較難或不確定的請求升級至能力較強的模型。指南比較靜態規則、分類器分流及按信心門檻檢查答案三種方式,並指出模型備援清單只會在請求出錯後重試,答案品質檢查及升級決策須由應用程式負責。指南建議比較答案接受率、包括被棄用嘗試的總成本、升級率及整輪延遲,並只在評估顯示升級能修正失敗答案時加入升級。
OpenRouter 的文章按工作流程編排、模型路由和供應商路由三層,對照 LangChain、LangGraph、CrewAI 與 OpenRouter 原生路由的職責。
AWS Professional Services 以 Amazon Bedrock AgentCore 部署四智能體方案,協助擴展雲端遷移並處理組織特定需求。
文章示範如何將 Amazon S3 Vectors 設為 NVIDIA NeMo Agent Toolkit(NAT)的持久記憶層,並把智能體工作流部署到 Amazon EKS。
Amazon Bedrock AgentCore 的參考實作把 Amazon S3 上傳或排程事件轉成智能體工作,並讓智能體在需要澄清、審批或覆核時暫停等待人員回應。
推薦理由:文章把事件來源、AgentCore 執行與人在迴路處理串成參考架構,並清楚區分樣本內建能力與需自行擴展的訊號來源。
這篇指南示範如何從空資料夾建立 Claude Code mod,並以約 80 行的 Token Weather 在提示詞上方顯示上下文窗口用量的即時預報。
OpenRouter 提出三步框架,按任務設定品質門檻、以自有樣本測量模型成本和品質,再選擇成本最低且以足夠餘量達標的模型。比較建議涵蓋 20 至 50 個自有例子,並以 usage.cost 記錄每次請求的實際支出;達標幅度須高於多次測試觀察到的分數波動。
OpenRouter 的指南示範如何把固定 LLM 評測集接入 GitHub Actions,並按通過率阻止不合格的 Pull Request 合併。指南建議把評測案例與提示詞一同存入版本庫,以多次抽樣的多數結果評分,並在未變動的 main 分支上重複執行以校準門檻。CI 應在 job 層級按相關檔案觸發,並把路徑篩選 job 和評測 job 都設為必需狀態檢查,以免跳過評測後仍可合併。
OpenRouter 的指南説明,如何讓模型回報自評信心分數,並按閾值把低分請求轉交較強模型處理。指南建議用結構化輸出要求模型提供數值信心欄位,再以自有流量中不同分數區間的錯誤率設定閾值;分數適合用來排序,不代表經校準的正確機率。上線後應監察升級比例及未升級回答的錯誤率,並在模型或流量變化時重新調整,同時權衡準確度、成本和延遲。
Google Cloud 工程師 Dani Zamora 與 Merge 的 Matthew Feroz 在影片中示範,如何於 60 分鐘內建立跨框架的 AI 智能體端到端評測流程。
NVIDIA NeMo Relay 用於追蹤智能體 Harness 行為,揭示最終答案掩蓋的低效步驟。搜尋失敗後再次搜尋,或檔案讀取遭截斷後再以命令擷取相同內容,會增加延遲和 token 消耗,也增加出錯機會。
Torch Spyre 透過智能體測試選擇流程、宣告式 YAML 測試重用框架及可靠工作流程,完成 PyTorch CRCR 的 L2 整合。測試選擇流程根據程式碼和實際執行結果篩選及分類測試;從 PyTorch 2.13 升級至 2.14 時,只需評估約 4000 項變更測試,而非數萬項。
NVIDIA TensorRT Model Connect 是一個面向編碼智能體設計、基於 NVIDIA TensorRT 建構的開源 C++ AI 模型參考實作集合。其開發經驗包括並行工作、模型家族隔離、可逆變更,以及 GPU 支援的驗證。
文章展示如何在 AlloyDB for PostgreSQL 中整合 TypeSafe AI 的 Jev 模型,直接對資料庫資料執行語義篩選與分類。作者以 PostgreSQL 陣列批次處理 50 筆商品,將多項模型評估合併成一次 HTTP 請求;測試耗時約 180 毫秒,逐行使用 Jev 約需 5,600 毫秒,預設模型約需 19,500 毫秒。
AWS 介紹 Amazon Quick 的提示詞工程基礎,整理適用於不同功能的通用原則與可複用框架。文章涵蓋明確具體、提供業務背景、以示例指定輸出,以及 CRISPE、RADAR、ARCHITECT 和 QUEST 等框架,並介紹中繼資料檢索、多角度分析與情境規劃。文中以 RFI 問卷自動化示範 Quick Flow 如何把多工作表資料整理為四欄 CSV,並稱可將原需數小時的處理縮至數分鐘。
Sebastian Raschka 梳理文本分類由詞袋模型、RNN/CNN 到 Transformer 的演進,並介紹 Jev 的分類 API 及其多任務表現。
vLLM 的拆分式服務指南説明如何將大語言模型(LLM)推理中的 prefill、decode 和 CPU 前端工作分開部署,並提供 v0.30.0 或更新版本的操作示例。
Gemini Live API 可用於建立即時語音 AI 智能體,透過雙向 WebSocket 同時傳送和接收音訊,支援即時回應及用戶插話。建議並行處理麥克風上行音訊與模型下行語音,並在麥克風偵測到用戶説話時立即靜音及清除播放緩衝區;Gemini Live 內置 VAD 負責偵測語音活動。工具操作可非同步執行並即時回傳確認,避免較慢的外部操作令語音生成停頓。
文章提出 7 種在生產環境加固 AI 智能體沙盒的方法,並指出標準 Docker 容器共用主機作業系統核心。建議採用 gVisor 或 microVM 作核心隔離,把 API 金鑰留在沙盒外並透過閘道呼叫,預設限制所有階段的外連,並按整個工作階段累計工具操作及預算。其餘措施包括隔離工作區並保護 CI/測試檔案、使用按活躍 CPU 計費的無伺服器環境,以及把審計日誌即時傳送至沙盒外。
GitHub Security Lab 使用開源 AI 安全 Agent 審計 Android 應用程式,至今已找出並回報 24 個漏洞。作者透過區分流動與非流動入口、按入口類型指定漏洞檢查,並結合嚴格與廣泛提示進行多輪審計。
GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。
推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。
GitHub 逐步將 Primer 元件及 dotcom 的樣式由 CSS-in-JS 遷移至 CSS Modules,並於 2026 年 6 月完成整體遷移。
作者測試 Claude Code 的 effort 等級後指出,較高 effort 會增加模型自主判斷、驗證和邊界案例測試,對需要嚴密驗證的工作尤其有用。Fable 5.1 在 Terminal-Bench 3.0 的安全類通過率由 low effort 組的 64% 升至 top effort 組的 87%,硬件類則由 34% 升至 75%。
Shadow roots 透過互動範例解説 shadow DOM,展示樣式封裝、繼承、slots、parts 及 JavaScript 存取方式。它們會建立隔離的 DOM 樹,包含私有樣式表與元素,並以特定且受控的方式與頁面 DOM 互動。
Anthropic 在 8 月以兩週衝刺,將 claude.ai 和 Claude 桌面應用程式的核心用戶體驗整體加快至原來約 3 倍。
推薦理由:這次衝刺展示了以可重複基準、CI 效能門檻和分階段上線構成優化閉環的方法,並由工程師把關改動風險與用戶體驗。
Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。
這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。
Trail of Bits 為審計 Miden VM,先花六個月以 AI 智能體從零建置工具,再在審計中發現安全漏洞。工具包括 LSP 伺服器、反編譯器、靜態分析引擎及 VM 執行器的 Lean 模型;分析找出逾 400 處可改善類型驗證的位置,並發現一項可讓惡意證明者偽造 Falcon 簽章、盜取由 Falcon 金鑰對控制的 Miden 帳戶資金的高危漏洞。
Together AI 分享由閉源模型轉向開源模型的遷移流程,涵蓋候選模型篩選、評測、調整、決策和投產。文章建議以真實流量評估準確度、效能及成本,並逐項調整提示詞、推理設定、工具環境或模型權重。Together AI 表示,部分客戶轉用開源模型後成本減幅可達 70%;投產時可先以 10% 流量進行金絲雀部署。
Ai2 與華盛頓大學透過 GenAI for Science: Ai2–UW Materials Challenge,讓學生使用 AI 智能體 AutoDiscovery 探索數據、提出科研假設並核驗結果。
研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。
Sebastian Raschka 分析 GPT-6 Astra 的電腦操作表現與循環式 Transformer 傳聞,指出 Astra 表現突出,但採用該架構尚未獲官方確認。
推薦理由:文章比較循環式 Transformer 的權重共享、計算成本與路由設計,並指出現有資料尚不足以將推理鏈可監控性的變化歸因於這種架構。
呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。
文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。
Google 在 2023 年宣佈 RT-2,將多模態大語言模型訓練成可直接生成機械人動作的 VLA 模型,帶動以此架構為基礎的機械人研究熱潮。文章梳理 Physical Intelligence 等團隊以動作分段、強化學習、記憶和視覺推理改善機械人操作與複雜任務能力,並探討 VLA 與世界模型的關係。