跳到正文

#教學/實踐

今日 8 條
10月3日週六
  1. OpenAI Developers:Blog64

    重新思考 GPT-6 Astra 的技能與提示詞

    OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。

10月2日週五
  1. GitHub Blog · AI & ML35

    AI 正改變開發者的工作方式:三項值得加強的技能

    AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。

  2. OpenRouter:Announcements62

    OpenRouter 教學:客服機械人的低成本優先 FAQ 模型路由

    OpenRouter 的指南介紹客服機械人採用低成本優先模型路由的方法,讓較小、成本較低的模型處理常見問題,並把較難或不確定的請求升級至能力較強的模型。指南比較靜態規則、分類器分流及按信心門檻檢查答案三種方式,並指出模型備援清單只會在請求出錯後重試,答案品質檢查及升級決策須由應用程式負責。指南建議比較答案接受率、包括被棄用嘗試的總成本、升級率及整輪延遲,並只在評估顯示升級能修正失敗答案時加入升級。

  3. AWS Machine Learning Blog66

    如何用 Amazon Bedrock AgentCore 構建環境式智能體,串聯事件觸發與人在迴路工作流

    Amazon Bedrock AgentCore 的參考實作把 Amazon S3 上傳或排程事件轉成智能體工作,並讓智能體在需要澄清、審批或覆核時暫停等待人員回應。

    推薦理由:文章把事件來源、AgentCore 執行與人在迴路處理串成參考架構,並清楚區分樣本內建能力與需自行擴展的訊號來源。

10月1日週四
  1. OpenRouter:Announcements71

    如何在 CI 中以 LLM 評測結果把關 Pull Request

    OpenRouter 的指南示範如何把固定 LLM 評測集接入 GitHub Actions,並按通過率阻止不合格的 Pull Request 合併。指南建議把評測案例與提示詞一同存入版本庫,以多次抽樣的多數結果評分,並在未變動的 main 分支上重複執行以校準門檻。CI 應在 job 層級按相關檔案觸發,並把路徑篩選 job 和評測 job 都設為必需狀態檢查,以免跳過評測後仍可合併。

  2. OpenRouter:Announcements65

    如何設定模型信心閾值,將低信心請求轉交較強模型

    OpenRouter 的指南説明,如何讓模型回報自評信心分數,並按閾值把低分請求轉交較強模型處理。指南建議用結構化輸出要求模型提供數值信心欄位,再以自有流量中不同分數區間的錯誤率設定閾值;分數適合用來排序,不代表經校準的正確機率。上線後應監察升級比例及未升級回答的錯誤率,並在模型或流量變化時重新調整,同時權衡準確度、成本和延遲。

9月30日週三
  1. Google AI:DEV 作者專屬52

    如何以 AlloyDB for PostgreSQL 整合 Jev 模型,實現亞秒級語義篩選

    文章展示如何在 AlloyDB for PostgreSQL 中整合 TypeSafe AI 的 Jev 模型,直接對資料庫資料執行語義篩選與分類。作者以 PostgreSQL 陣列批次處理 50 筆商品,將多項模型評估合併成一次 HTTP 請求;測試耗時約 180 毫秒,逐行使用 Jev 約需 5,600 毫秒,預設模型約需 19,500 毫秒。

  2. AWS Machine Learning Blog51

    Amazon Quick 提示詞工程基礎:通用原則與結構化框架

    AWS 介紹 Amazon Quick 的提示詞工程基礎,整理適用於不同功能的通用原則與可複用框架。文章涵蓋明確具體、提供業務背景、以示例指定輸出,以及 CRISPE、RADAR、ARCHITECT 和 QUEST 等框架,並介紹中繼資料檢索、多角度分析與情境規劃。文中以 RFI 問卷自動化示範 Quick Flow 如何把多工作表資料整理為四欄 CSV,並稱可將原需數小時的處理縮至數分鐘。

9月29日週二
  1. Google AI:DEV 作者專屬58

    如何使用 Gemini Live API 建立即時語音 AI 智能體

    Gemini Live API 可用於建立即時語音 AI 智能體,透過雙向 WebSocket 同時傳送和接收音訊,支援即時回應及用戶插話。建議並行處理麥克風上行音訊與模型下行語音,並在麥克風偵測到用戶説話時立即靜音及清除播放緩衝區;Gemini Live 內置 VAD 負責偵測語音活動。工具操作可非同步執行並即時回傳確認,避免較慢的外部操作令語音生成停頓。

  2. Google AI:DEV 作者專屬62

    如何在生產環境中加固 AI 智能體沙盒:Docker 容器以外的 7 種方法

    文章提出 7 種在生產環境加固 AI 智能體沙盒的方法,並指出標準 Docker 容器共用主機作業系統核心。建議採用 gVisor 或 microVM 作核心隔離,把 API 金鑰留在沙盒外並透過閘道呼叫,預設限制所有階段的外連,並按整個工作階段累計工具操作及預算。其餘措施包括隔離工作區並保護 CI/測試檔案、使用按活躍 CPU 計費的無伺服器環境,以及把審計日誌即時傳送至沙盒外。

9月26日週六
  1. GitHub Blog · AI & ML66

    GitHub Copilot app 初學者指南:如何用 canvases 建立自訂工作流程

    GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。

    推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。

9月25日週五
  1. Anthropic:Claude.dev 開發者博客73

    Claude Code:如何按任務分配 effort 等級

    作者測試 Claude Code 的 effort 等級後指出,較高 effort 會增加模型自主判斷、驗證和邊界案例測試,對需要嚴密驗證的工作尤其有用。Fable 5.1 在 Terminal-Bench 3.0 的安全類通過率由 low effort 組的 64% 升至 top effort 組的 87%,硬件類則由 34% 升至 75%。

9月24日週四
  1. Simon Willison32

    Shadow roots:透過即時範例解説

    Shadow roots 透過互動範例解説 shadow DOM,展示樣式封裝、繼承、slots、parts 及 JavaScript 存取方式。它們會建立隔離的 DOM 樹,包含私有樣式表與元素,並以特定且受控的方式與頁面 DOM 互動。

9月23日週三
  1. Modal 官方工程博客63

    Modal 如何為採用萬億參數模型的編碼智能體提供萬億級 token 推理服務

    Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。

9月22日週二
  1. Anthropic:Claude.dev 開發者博客67

    Opus 5.5 在 Claude 和 Claude Code 中的使用指南

    這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。

9月18日週五
  1. Trail of Bits:AI安全研究69

    Trail of Bits 以 AI 智能體建置工具審計 Miden VM,發現高危漏洞

    Trail of Bits 為審計 Miden VM,先花六個月以 AI 智能體從零建置工具,再在審計中發現安全漏洞。工具包括 LSP 伺服器、反編譯器、靜態分析引擎及 VM 執行器的 Lean 模型;分析找出逾 400 處可改善類型驗證的位置,並發現一項可讓惡意證明者偽造 Falcon 簽章、盜取由 Falcon 金鑰對控制的 Miden 帳戶資金的高危漏洞。

9月16日週三
  1. Together AI 研究與產品博客57

    Together AI 分享由閉源模型轉向開源模型的遷移策略

    Together AI 分享由閉源模型轉向開源模型的遷移流程,涵蓋候選模型篩選、評測、調整、決策和投產。文章建議以真實流量評估準確度、效能及成本,並逐項調整提示詞、推理設定、工具環境或模型權重。Together AI 表示,部分客戶轉用開源模型後成本減幅可達 70%;投產時可先以 10% 流量進行金絲雀部署。

9月14日週一
9月10日週四
  1. Amazon Science56

    機器學習研究智能體為何不會過度擬合?

    研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。

9月9日週三
9月5日週六
  1. Sierra:Blog44

    呼叫中心 AI:營運及推行指南

    呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。

9月3日週四
  1. Recode China AI54

    打造智能機械人需要大量數據,數據從何而來?

    文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。

  2. Timothy B. Lee:Understanding AI52

    Google 如何教大語言模型控制機械人,並帶動機械人熱潮

    Google 在 2023 年宣佈 RT-2,將多模態大語言模型訓練成可直接生成機械人動作的 VLA 模型,帶動以此架構為基礎的機械人研究熱潮。文章梳理 Physical Intelligence 等團隊以動作分段、強化學習、記憶和視覺推理改善機械人操作與複雜任務能力,並探討 VLA 與世界模型的關係。