跳到正文

#教學/實踐

今日 8 條
今天10月7日週三
  1. MarkTechPost64

    Laya 開發者指南:零樣本決策與校準

    MarkTechPost 的指南以 CLINC150 銀行意圖資料測試 Laya,在 15 個意圖的零樣本分類中取得 0.878 準確率。使用意圖名稱而非自訂描述,準確率由 0.804 升至 0.878;温度校準將 ECE 由 0.102 降至 0.059,但以驗證資料設定為 5% 錯誤率的拒答門檻,在測試集的錯誤率為 9.2%。

  2. Anthropic:Claude.dev 開發者博客80

    Claude Code 雲端工作階段實用指南

    Claude Code 雲端工作階段為每項任務建立獨立虛擬機和分支,讓多項工作並行,完成後可供檢視或建立 pull request。作者以示例倉庫測試三項並行工作,首項啟動後 87 秒全部完成,其中一項修正後連續執行 npm test 40 次且零失敗。雲端運算不另收費,但工作階段沿用方案用量額度。

    推薦理由:實測展示獨立虛擬機如何減少並行任務互相干擾,並整理任務拆分、驗證指令與分支合併的實用做法。

  3. Tomer Tunguz 博客(VC 分析)68

    Vercel 如何自動化銷售漏斗的入站線索處理

    Vercel 由一名投入約 20% 工時的工程師打造負責銷售漏斗頂端的智能體,項目於 6 月啟動,並在 8 月結束人工作業介入階段。團隊把提示詞拆分為規則與判斷,由工程師將 14 條規則寫成程式,模型只處理需要判斷的部分,另有智能體監察規則違規。

10月6日週二
  1. Tessl:產品與工程博客57

    規格驅動開發在以系統用例作規格時奏效

    AI Unified Process 以系統用例和領域模型作核心規格,讓 Agent 直接根據系統用例生成業務軟件,省略規劃與任務拆分階段。現代化項目先從舊系統逆向整理用例、實體模型、測試和文件,再交由業務人員審核,按行為生成新實作,而非直接轉換舊程式碼。生成流程配合技能、防護規則、架構指引、MCP 伺服器和測試,並按風險安排審查。

  2. 英國 AI Security Institute:Blog58

    英國 AI Security Institute 梳理能力日益增強的開放權重 AI 系統風險管理方法

    英國 AI Security Institute 概述開放權重通用 AI 系統的風險管理策略,涵蓋模型內防護、外部防護及程序措施。該機構指出,訓練資料篩選有助降低模型發佈風險,而具備完整模型存取權的審核可更準確評估風險,支援發佈決策。與 EleutherAI 及牛津大學合作的研究發現,從 LLM 訓練資料移除有害資料,抵禦對抗性微調的效果是訓練後加入防護的逾 10x,且未帶來顯著性能代價。

  3. 英國 AI Security Institute:Blog55

    使用 Inspect Scout 分析 AI 對話紀錄的七步流程

    英國 AI Security Institute 與 Meridian Labs 合作開發開源對話紀錄分析工具 Inspect Scout,並在新論文中提出使用它進行分析的七步流程。Inspect Scout 建基於 Inspect,可平行分析數千份對話紀錄,並透過掃描器把紀錄中的特定內容轉為易讀結果。流程涵蓋界定研究問題、整理及抽查資料、設計和驗證掃描器,並將結果用於即時排查或後續研究。

  4. 英國 AI Security Institute:Blog58

    英國 AI Security Institute 發佈 AISI Engineering Playbook,整理前沿 AI 評估方法與實踐

    英國 AI Security Institute 發佈 AISI Engineering Playbook,整理其評估前沿 AI 系統時建立的方法與實踐。手冊將評估所需基建分為 Evaluate、Isolate、Connect、Run 和 Scale 五層,並提供技術介紹及現有開源程式碼連結。研究人員可採用個別組件,機構亦可參照五層架構建立自己的評估平台。

  5. Thinking Machines Lab:News39

    Tinker 徵集社羣項目

    Tinker 邀請開發者和研究人員提交社羣項目,並計劃定期在網誌刊出精選成果。徵集涵蓋機器學習研究、微調模型應用、產品原型、數據集及基礎設施;投稿應附研究説明,最好開源程式碼,並展示嚴謹評估和透明結果。

  6. Eugene Yan:Writing71

    產品評測的三個簡單步驟

    Eugene Yan 提出產品評測的三步流程:標註小型數據集、校準 LLM 評估器,並在每次配置變更後執行實驗與評測。他建議採用二元標籤,在 200 個以上樣本中準備 50–100 個失敗案例,並以 75% 樣本校準、25% 留作測試;不同評測維度應使用獨立評估器。

  7. Eugene Yan:Writing73

    如何與 AI 協作,讓工作成果持續累積

    Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。

  8. Cohere 產品與研究博客32

    企業生成式 AI:應用案例、效益與採用方式

    企業可用生成式 AI 搜尋及整合知識、創作內容、提供對話支援、協助軟件開發與數據分析,並自動化多步工作流程。用得其所可提升生產力和工作質素、擴大個人化體驗,並加快創新。採用時須先確認生成式 AI 能否切合具體業務需要並值得投資,避免在缺乏明確商業理據下增加成本與複雜程度。

  9. Fireworks AI53

    企業如何邁向專門化智能並訓練自有模型

    Fireworks AI 的文章梳理企業邁向專門化智能的路徑,從租用封閉式前沿模型、加入開源模型,逐步走到微調自有模型。在 UIPad 測試中,Kimi K3 與 GPT 5.6 Sol 整體同為 87.7 分,但 Kimi K3 執行成本為 $56,GPT 5.6 Sol 為 $115;按題型分流,可把座標題交給 Sol,其餘題目交給 K3。

  10. Goodfire Research53

    神經網絡內部表徵以幾何結構映照外界

    Goodfire Research 指出,神經網絡內部表徵會形成映照外界結構的幾何形狀,並以 Mountain Car 模型示範沿彎曲流形操控表徵可平順改變車輛位置。相比之下,線性操控可能令模型輸出混亂,或令車輛跳到另一位置。文章認為,研究神經幾何有助理解模型表徵、計算與行為,並支持更精準、可靠的模型控制。

  11. Suno:Blog51

    Suno Voices:提升人聲品質的 6 個技巧

    Suno 分享了使用 Voices 製作高質素人聲的 6 個技巧,涵蓋安靜錄音、事前練習及按曲風配搭聲線。可行的話,建議錄製至少一分鐘的人聲參考;較長錄音能讓 Suno 學習更多內容,令整首曲目的人聲結果更一致。Voices 現已可在 Web、iOS 和 Android 使用,並提供免費試用及付費方案。

  12. Claude:Blog56

    Anthropic 分享 AI 驅動程式碼現代化項目的籌備方法

    Anthropic 的前線部署工程師分享企業籌備 AI 驅動程式碼現代化項目的六步方法,涵蓋界定目標、驗收條件、變更上線政策、前置準備、智能體工作流程及正式執行。文章建議以 Claude Code 建立按項目調整的工作流程,先在小部分程式碼上端到端試行,再擴展至完整程式碼庫。試行期間可量度 tokens 用量以估算成本,並把計算量大的驗證安排在較簡單的檢查通過後執行。

  13. Suno:Blog17

    為何要在 Suno 發佈你的音樂作品

    Suno 鼓勵創作者發佈音樂作品,讓作品接觸數以百萬計的聽眾。發佈有助創作者獲得聽眾回饋、瞭解哪些內容引起共鳴,並改善下一首作品。公開作品亦可讓社羣其他創作者重新混音,為彼此帶來靈感。

  14. Replit:Blog55

    Replit 説明如何以評估閉環持續改進 Replit Agent

    Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。

  15. Claude:Blog59

    Anthropic 銷售團隊如何以 Claude Managed Agents 重建銷售查詢流程

    Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。

  16. 英國 AI Security Institute:Blog65

    英國 AI Security Institute 説明如何加強危險能力評測環境的安全

    英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。

  17. 小米 MiMo:官網發佈與博客54

    MiMo-V2.5 系列全流程推理優化實踐

    小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。

  18. Cerebras:Blog53

    Cerebras 教 AI 智能體以自然語言測試 Cloud Console

    Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。

  19. Databricks:Blog55

    Databricks 分享挑選首批高影響力 Genie Agents 的方法

    Databricks 分享一套挑選首批 Genie Agents 的方法,建議團隊按五項準則評估候選工作流程,篩選適合作為試點的項目。準則涵蓋業務影響、需求頻率與重複性、數據與元數據準備度、範圍清晰度,以及治理和風險適配度;各項按 1–5 分評分,總分 20–25 可立即開發,14–19 需進一步完善,低於 14 則暫不適合。若沒有業務負責人或高層主管積極支持,即使評分高也應暫緩。

  20. AWS Machine Learning Blog55

    Amazon Bedrock AgentCore Evaluations 教學:評估多智能體系統的可解釋性與有用性

    AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。

10月5日週一