Laya 開發者指南:零樣本決策與校準
MarkTechPost 的指南以 CLINC150 銀行意圖資料測試 Laya,在 15 個意圖的零樣本分類中取得 0.878 準確率。使用意圖名稱而非自訂描述,準確率由 0.804 升至 0.878;温度校準將 ECE 由 0.102 降至 0.059,但以驗證資料設定為 5% 錯誤率的拒答門檻,在測試集的錯誤率為 9.2%。
MarkTechPost 的指南以 CLINC150 銀行意圖資料測試 Laya,在 15 個意圖的零樣本分類中取得 0.878 準確率。使用意圖名稱而非自訂描述,準確率由 0.804 升至 0.878;温度校準將 ECE 由 0.102 降至 0.059,但以驗證資料設定為 5% 錯誤率的拒答門檻,在測試集的錯誤率為 9.2%。
Google Cloud Run 可讓用戶免費領取易記、全球可用的自訂子網域,為示範應用及 AI 原型建立可分享網址。部署只需一條命令,毋須設定負載平衡器、DNS 記錄或 CNAME;Cloud Run 會自動處理 SSL/TLS 憑證及全球路由。
GitHub 正重建 Git 基礎設施,以支援開發者與智能體在高提交量倉庫中的並行協作。新架構將權威資料存於 Azure Blob Storage,並把儲存與計算分層,讓讀取容量獨立擴展;推送流程中只保留參照更新所需的協調。GitHub 表示,內部基準測試中寫入吞吐量最高提升 35 倍。
文章示範如何以 OpenClaw 和 Amazon Bedrock AgentCore 建構可累積上下文的 AI 助手,並以 Sprout 園藝助手展示整體架構。
推薦理由:文章以 OpenClaw 和 AgentCore 示範記憶檢索、用戶資料隔離及提示詞快取的設計,並整理可移植至其他領域的智能體部署方法。
Claude Code 雲端工作階段為每項任務建立獨立虛擬機和分支,讓多項工作並行,完成後可供檢視或建立 pull request。作者以示例倉庫測試三項並行工作,首項啟動後 87 秒全部完成,其中一項修正後連續執行 npm test 40 次且零失敗。雲端運算不另收費,但工作階段沿用方案用量額度。
推薦理由:實測展示獨立虛擬機如何減少並行任務互相干擾,並整理任務拆分、驗證指令與分支合併的實用做法。
Vercel 由一名投入約 20% 工時的工程師打造負責銷售漏斗頂端的智能體,項目於 6 月啟動,並在 8 月結束人工作業介入階段。團隊把提示詞拆分為規則與判斷,由工程師將 14 條規則寫成程式,模型只處理需要判斷的部分,另有智能體監察規則違規。
AWS 教程示範如何在航空應用程式中,以 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova 2.5 Sonic 建立語音旅遊禮賓服務。
AWS 説明如何在 SageMaker Unified Studio 專案中提供核准的 Amazon SageMaker HyperPod 運算資源,同時讓基礎設施團隊保留叢集管理權。
IFCO 數據團隊與 Databricks Forward Deployed Engineering 合作優化大型 dbt 項目的增量處理,將核心語義層每日執行時間由約 7 小時降至 2 小時 20 分鐘,並取消夜間全量刷新。
AI Unified Process 以系統用例和領域模型作核心規格,讓 Agent 直接根據系統用例生成業務軟件,省略規劃與任務拆分階段。現代化項目先從舊系統逆向整理用例、實體模型、測試和文件,再交由業務人員審核,按行為生成新實作,而非直接轉換舊程式碼。生成流程配合技能、防護規則、架構指引、MCP 伺服器和測試,並按風險安排審查。
英國 AI Security Institute 概述開放權重通用 AI 系統的風險管理策略,涵蓋模型內防護、外部防護及程序措施。該機構指出,訓練資料篩選有助降低模型發佈風險,而具備完整模型存取權的審核可更準確評估風險,支援發佈決策。與 EleutherAI 及牛津大學合作的研究發現,從 LLM 訓練資料移除有害資料,抵禦對抗性微調的效果是訓練後加入防護的逾 10x,且未帶來顯著性能代價。
英國 AI Security Institute(AISI)與美國 Center for Standards and Innovation(CAISI)和 Anthropic、OpenAI 合作,識別並修補 AI 系統漏洞,強化模型安全防護。
英國 AI Security Institute 與 Meridian Labs 合作開發開源對話紀錄分析工具 Inspect Scout,並在新論文中提出使用它進行分析的七步流程。Inspect Scout 建基於 Inspect,可平行分析數千份對話紀錄,並透過掃描器把紀錄中的特定內容轉為易讀結果。流程涵蓋界定研究問題、整理及抽查資料、設計和驗證掃描器,並將結果用於即時排查或後續研究。
英國 AI Security Institute 發佈 AISI Engineering Playbook,整理其評估前沿 AI 系統時建立的方法與實踐。手冊將評估所需基建分為 Evaluate、Isolate、Connect、Run 和 Scale 五層,並提供技術介紹及現有開源程式碼連結。研究人員可採用個別組件,機構亦可參照五層架構建立自己的評估平台。
Cerebras 分享一份 GPT-5.3-Codex-Spark 編碼實踐指南,建議以快速、密集的互動取代長提示詞和多代理並行。GPT-5.3-Codex-Spark 在 Cerebras WSE 硬件上運行,生成速度超過 1,200+ tokens/second。指南建議將工作拆成小目標,逐步執行測試,並以文件和 Git 保存跨工作階段狀態。
作者以 Codex、Figma MCP 和多智能體協作流程,將網站 5 個頁面近乎完美地複製到 Figma,耗時不到 5 分鐘。流程由主協調 Agent 為每個子 Agent 分配一頁,再審核結果並按需派發修正;作者先用 GPT-5.4-Medium 反覆調整指示,再以 GPT-5.3-Codex-Spark 執行。
Tinker 邀請開發者和研究人員提交社羣項目,並計劃定期在網誌刊出精選成果。徵集涵蓋機器學習研究、微調模型應用、產品原型、數據集及基礎設施;投稿應附研究説明,最好開源程式碼,並展示嚴謹評估和透明結果。
Eugene Yan 以 Semantic IDs 微調 Qwen3-8B,訓練出可根據用戶互動及自然語言指令調整推薦的 LLM 推薦系統混合模型。他以 RQ-VAE 將商品嵌入向量編碼為階層式 Semantic IDs,並建立 4.2 million 組涵蓋 ID 與商品描述互轉、下一項預測等任務的對話訓練例子。
Eugene Yan 提出產品評測的三步流程:標註小型數據集、校準 LLM 評估器,並在每次配置變更後執行實驗與評測。他建議採用二元標籤,在 200 個以上樣本中準備 50–100 個失敗案例,並以 75% 樣本校準、25% 留作測試;不同評測維度應使用獨立評估器。
Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。
企業可用生成式 AI 搜尋及整合知識、創作內容、提供對話支援、協助軟件開發與數據分析,並自動化多步工作流程。用得其所可提升生產力和工作質素、擴大個人化體驗,並加快創新。採用時須先確認生成式 AI 能否切合具體業務需要並值得投資,避免在缺乏明確商業理據下增加成本與複雜程度。
Prime Intellect 探討全球分散式訓練方法,説明如何整合各地 GPU 資源訓練 AI 模型。文中介紹 Google DeepMind 的 DiLoCo,利用內外層最佳化,讓各運算島約每 500 次更新才同步梯度,以減少通訊負擔。全球部署仍要應對頻寬有限、硬件規格不一、算力變動及容錯等問題。
Fireworks AI 的文章梳理企業邁向專門化智能的路徑,從租用封閉式前沿模型、加入開源模型,逐步走到微調自有模型。在 UIPad 測試中,Kimi K3 與 GPT 5.6 Sol 整體同為 87.7 分,但 Kimi K3 執行成本為 $56,GPT 5.6 Sol 為 $115;按題型分流,可把座標題交給 Sol,其餘題目交給 K3。
Goodfire Research 指出,神經網絡內部表徵會形成映照外界結構的幾何形狀,並以 Mountain Car 模型示範沿彎曲流形操控表徵可平順改變車輛位置。相比之下,線性操控可能令模型輸出混亂,或令車輛跳到另一位置。文章認為,研究神經幾何有助理解模型表徵、計算與行為,並支持更精準、可靠的模型控制。
Suno 分享了使用 Voices 製作高質素人聲的 6 個技巧,涵蓋安靜錄音、事前練習及按曲風配搭聲線。可行的話,建議錄製至少一分鐘的人聲參考;較長錄音能讓 Suno 學習更多內容,令整首曲目的人聲結果更一致。Voices 現已可在 Web、iOS 和 Android 使用,並提供免費試用及付費方案。
Anthropic 的前線部署工程師分享企業籌備 AI 驅動程式碼現代化項目的六步方法,涵蓋界定目標、驗收條件、變更上線政策、前置準備、智能體工作流程及正式執行。文章建議以 Claude Code 建立按項目調整的工作流程,先在小部分程式碼上端到端試行,再擴展至完整程式碼庫。試行期間可量度 tokens 用量以估算成本,並把計算量大的驗證安排在較簡單的檢查通過後執行。
Suno 鼓勵創作者發佈音樂作品,讓作品接觸數以百萬計的聽眾。發佈有助創作者獲得聽眾回饋、瞭解哪些內容引起共鳴,並改善下一首作品。公開作品亦可讓社羣其他創作者重新混音,為彼此帶來靈感。
Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。
生物研究環境 Biomni Lab 的開發者 Phylo 將大部分流量轉至 Fireworks 上的開放權重模型,推理成本降低 60%,用戶月度增長達 2x。Phylo 以自家的 BiomniBench 按品質、延遲和成本評估模型,並保留專有模型處理最難的一類問題。
Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。
英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。
Google Cloud 介紹以 Memorystore for Valkey 和 AlloyDB AI 分別處理短期會話快取與長期記憶的 AI 智能體雙層架構。
小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。
Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。
Databricks 分享一套挑選首批 Genie Agents 的方法,建議團隊按五項準則評估候選工作流程,篩選適合作為試點的項目。準則涵蓋業務影響、需求頻率與重複性、數據與元數據準備度、範圍清晰度,以及治理和風險適配度;各項按 1–5 分評分,總分 20–25 可立即開發,14–19 需進一步完善,低於 14 則暫不適合。若沒有業務負責人或高層主管積極支持,即使評分高也應暫緩。
PyTorch 在過去兩年整合媒體處理架構,由 TorchCodec 集中負責圖像、影片和音訊的解碼與編碼,TorchVision 和 TorchAudio 則專注處理媒體轉換。
AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。
AWS 文章示範如何以 LangChain 在 Amazon Bedrock Knowledge Bases 建立 RAG 應用,並比較標準檢索與 Agentic retrieval 處理多部分問題的方式。
AWS 示範以部署在 Amazon Bedrock AgentCore 的 Quick Resource Migrator MCP 伺服器,自動化 Amazon Quick 資源的跨帳戶推廣。
作者分享共同帶領面向法律及治理從業者的 AI 安全訓練營時學到的內容。現有資料只有標題及 Hacker News 貼文資訊,沒有文章正文,無法確認具體心得。