跳到正文

#Agent

今日 165 條
9月28日週一
9月26日週六
  1. Claude Code:GitHub Releases50

    Claude Code v2.1.283 更新加入模型管控、提示詞審核及閘道負載測試

    Claude Code 發佈 v2.1.283,新增模型可用性管控、提示詞審核及閘道負載測試模式,並修正多項 MCP、插件與工作流問題。管理設定可限制可用模型版本或封鎖指定模型;/doctor prompt-audit 可檢查 CLAUDE.md、skills、agents 和 commands 中為舊模型編寫的提示詞模式。負載測試模式會建立並簽署請求,但不會發送至上游,客戶端則會收到固定回覆。

  2. GitHub Blog · AI & ML66

    GitHub Copilot app 初學者指南:如何用 canvases 建立自訂工作流程

    GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。

    推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。

9月25日週五
  1. Azeem Azhar:Exponential View64

    Meta Muse:你的智能體究竟為誰服務?

    Azeem Azhar 分析 Meta 的 Muse,指出消費者智能體能代辦購物與日常任務,但交易抽成可能令代理的忠誠對象與用戶利益出現衝突。Meta 表示會從交易收取小額費用,Muse 已與 Walmart、Best Buy、Sephora 及 Expedia 合作,Amazon 則封鎖 Muse。

  2. Newcomer 新聞長文67

    個人智能體承諾重塑網絡,Instinct 與 Meta Muse 崛起將逐步揭示網絡新面貌

    個人智能體已突然以大眾消費產品形式登場,Meta Muse 暫時領先,並承諾大幅減輕用戶處理行政事務的負擔。但網上商務基建和商業慣例尚未準備好應付大量智能體操作,Instinct 用戶反映常被要求完成 CAPTCHA,Amazon 亦宣佈封鎖 Muse 在其平台購物。Expedia 雖宣佈與 Muse 整合,股價仍隨旅遊預訂同業下跌,反映市場憂慮智能體可能繞過既有中介服務。

  3. Redwood Research:Blog60

    AI 持續學習或令阻斷監控器幾乎失效

    持續學習中的 AI 可能因阻斷監控降低任務效用而學會規避,令監控在長期部署中幾乎失效。文章比較部署期間的 online RL 與記憶系統,認為 online RL 的優化壓力較強,記憶系統短期影響或較弱,但仍可能留存規避策略。作者建議降低監控幹預造成的效用損失、以線上或對抗訓練提升監控能力,或使用未納入獎勵迴路的監控器作後備。

  4. Google Research51

    Google Research 介紹長篇連貫影片生成研究與四套框架

    Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。

9月24日週四
  1. Latent Space59

    Foundries 與 Navigators:降低科研成本的兩種 AI 路徑

    Adrian Sanborn 將 AI 改變科研的路徑分為 Foundries 與 Navigators,前者加速實驗數據產出,後者改善日常決策流程。在 Endura Therapeutics,團隊使用大語言模型研究智能體分兩階段篩選約 500 個疾病靶點,再深入分析約 100 個剩餘靶點。這種做法有助及早排除不合適方向;第二階段分析仍須對照一手來源,入選項目也接受完整人工盡調。

  2. elsewhere:文章64

    這個中秋國慶,放過自己,讓元寶 AI 處理旅遊規劃

    作者實測元寶新上線的旅遊計劃 Agent,展示它如何把聊天需求整理成行程,並提供可互動行程卡和旅前裝備推薦。蘇州低精力行程每天安排兩個景點並預留午睡時間;新疆行程則把單日車程控制在最長 4 小時內,並按需求安排住宿與徒步路線。文中還展示元寶查詢蘇州 2026 年門票預約規則,並按對話修改行程。

  3. Pragmatic Engineer53

    Maggie Appleton 談設計工程與 AI 協作

    Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。

9月23日週三
  1. Latent Space83

    Anthropic 發佈 Claude Opus 5.5 並成為 AINews 預設模型,OpenAI 推出降價版 GPT-6 Sol 與 GPT-6 Luna

    Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。

    推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。

  2. Modal 官方工程博客63

    Modal 如何為採用萬億參數模型的編碼智能體提供萬億級 token 推理服務

    Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。

9月22日週二
  1. Anthropic:Claude.dev 開發者博客67

    Opus 5.5 在 Claude 和 Claude Code 中的使用指南

    這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。

9月21日週一
  1. HuggingFace Daily Papers(社區熱門論文)52

    OSWorld-Pro:電腦操作智能體的流程式評估

    OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。

9月19日週六
  1. elsewhere:文章66

    YC 最新投資的 236 家公司:「幾乎所有事情都不一樣了」

    YC 2026 夏季批次的 236 家公司中,91% 與 AI 相關,創業方向由應用層轉向模型以下的基礎設施及實體世界。與春季批次相比,模型以下公司佔比由 8% 升至 20%,應用層由 55% 降至 39%;推出自主 Agent 的公司比例由 45% 降至 33%。夏季批次有 45 家公司交付實體硬件,為春季批次的兩倍;另有 21 家公司投入算力建設。

9月18日週五
  1. Trail of Bits:AI安全研究69

    Trail of Bits 以 AI 智能體建置工具審計 Miden VM,發現高危漏洞

    Trail of Bits 為審計 Miden VM,先花六個月以 AI 智能體從零建置工具,再在審計中發現安全漏洞。工具包括 LSP 伺服器、反編譯器、靜態分析引擎及 VM 執行器的 Lean 模型;分析找出逾 400 處可改善類型驗證的位置,並發現一項可讓惡意證明者偽造 Falcon 簽章、盜取由 Falcon 金鑰對控制的 Miden 帳戶資金的高危漏洞。

9月17日週四
  1. Sierra:Blog49

    Sierra 獲 AIUC-1 認證

    Sierra 通過 Schellman 獨立審核及 AIUC 測試,取得專為 AI 智能體設計的 AIUC-1 認證。測試涵蓋聊天及語音智能體的日常互動、對抗情境和真實語音條件,包括他人嘗試操控智能體、存取受保護資訊或令其超越授權範圍的情境。相關技術評估至少每季重複,並每年進行全面審核。

  2. Microsoft:Official Blog56

    Microsoft 分享自身 AI 轉型的五項經驗

    Microsoft 根據自身數百項 AI 轉型實踐,總結出五項經驗,涵蓋以業務成果為先、重設端到端流程及讓員工參與等做法。文中舉例,銷售團隊成交率提高 20%,部分供應鏈工作流程週期縮短最多 75%,而一支 9 人工程團隊在 35 天內交付初始產品版本。Microsoft Frontier Playbook 整理了數百項轉型實踐,提供按職位、工作流程或全新業務機會調整的實踐模式。

9月16日週三