跳到正文

#Agent

今日 165 條
9月16日週三
  1. OpenClaw:Blog53

    OpenClaw 推出安全資訊頁,集中呈現安全狀態及漏洞回報指引

    OpenClaw 推出安全資訊頁,集中呈現目前安全狀態、安全公告、持續工作、研究及漏洞回報指引。自 1 月以來,項目已發布 722 項修復;14 宗回報涉及經確認的嚴重漏洞,全部已修復並披露。OpenClaw 亦公開包含超過 67,000 次 ClawHub 技能掃描的數據集,並列出掃描技能、阻止安裝惡意或已隔離技能等持續工作。

  2. Manus:Blog50

    Manus 擴大實用 AI 學習的普及範圍

    Manus 宣佈透過 SkillsFuture AI Subscription 計劃及 Singtel AI Pass 在新加坡展開合作,結合結構化學習、AI 工具使用權與持續實踐機會。符合資格學員可透過 Singtel AI Pass 試用精選高級 AI 工具三個月,再選一項續用三個月;Manus 課程涵蓋基礎、中級、進階及特定職位學習內容。

9月15日週二
  1. Pragmatic Engineer73

    OpenAI 智能體軟件工廠的內部運作

    OpenAI 圍繞 Codex 運作智能體軟件工廠,讓智能體參與編碼、測試、審查、部署及生產監控。Perf Factory 會整理告警與儀錶板、識別延遲回退並提出修復建議,部署智能體亦會監測變更相關訊號。Codex 帶來的程式碼增量令部分建置、測試及部署系統在約 6 個月內負荷增至約 10 倍,團隊因此重新思考 PR 和程式碼審查流程。

9月14日週一
9月12日週六
  1. Dwarkesh Patel:Podcast & Blog59

    AI 研究者辯論距離遞歸式自我改進還有多遠

    Dwarkesh Patel 與 John Schulman、Beren Millidge 和 Charlie O’Neill 探討現行訓練方法能否推動 AI 遞歸式自我改進。對談聚焦模型能否自行設定研究目標、從訓練環境泛化至現實任務,以及樣本效率和持續學習的限制。嘉賓亦討論蒸餾、RL 環境和部署數據對模型迭代的作用,以及長期判斷和目標設定的難處。

9月11日週五
9月10日週四
  1. Amazon Science56

    機器學習研究智能體為何不會過度擬合?

    研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。

  2. Cursor Blog79

    Cursor 推出 Projects,支援長週期多智能體工作

    Cursor 推出 Projects,現正以 beta 階段逐步向所有用户開放,讓協調智能體承接跨月工作並委派子智能體。Projects 預設在雲端運行,需要時可切換至本地,並透過共享上下文及監聽 Slack 頻道、按計劃運行或跟進 PR 來主動處理工作。Cursor 表示,新用户合併 PR 數量提升 30%,而主要使用 Projects 的用户合併量達原來六倍。

    推薦理由:Projects 將長週期工作的上下文累積、智能體委派和事件觸發整合起來,文中亦提供新用户與主要使用者的 PR 合併量數據。

  3. OpenAI News63

    OpenAI 推出 Agents API,供建置及啟動雲端智能體

    OpenAI 推出 Agents API,這項由 Codex harness 驅動的託管服務可用於建置及啟動雲端智能體。服務支援編排、長時段工作階段與工具使用。詳情見 https://openai.com/index/introducing-the-agents-api。

    推薦理由:這則公告交代 Agents API 將編排、長時段工作階段與工具使用納入雲端智能體託管服務,清楚界定其運作範圍。

9月9日週三
  1. Sierra:Blog60

    Hyper-𝜏-bench 評估模型建構智能體的能力

    Sierra 開源 Hyper-𝜏-bench(發表名稱為 𝜏^𝜏-bench),評估模型能否建構客服智能體,而不只是充當智能體。測試把開發智能體放進模擬業務沙盒,要求它從證據還原規格、設計架構並完成客服智能體,再以開發期間未見的測試檢驗成品。

  2. Pragmatic Engineer63

    AI 智能體生成程式碼激增後,程式碼審查有哪些新做法?

    面對 AI 智能體生成更多程式碼和 PR 所帶來的審查量增長,各團隊採用不同流程,沒有適用所有團隊的單一方案。GitHub 數據顯示,三年間開啟的 PR 數量增至五倍,2025 年底增長加速,PR 和 commits 數量在當時幾乎翻倍。常見做法包括由人審核 AI 的程式碼審查結果、按變更風險決定是否人工審查,以及改為審查計劃、測試或資料庫 schema。

9月7日週一
9月6日週日
9月5日週六
  1. Sierra:Blog44

    呼叫中心 AI:營運及推行指南

    呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。

  2. GitHub Blog · AI & ML67

    Project HydraFusion 以多模型編排提供前沿級品質

    GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。

    推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。

9月4日週五
9月3日週四
  1. Hugging Face Blog73

    Hugging Face 推出開源工具 funes,為編碼智能體提供可檢索的持久記憶

    Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。

    推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。

  2. OpenAI:部署安全與系統卡73

    GPT-6 Astra 系統卡公佈安全與能力評估結果

    OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。

  3. Google DeepMind60

    Google DeepMind 推出 Fairwind Program,向政府機構及可信賴夥伴有限度開放 AI 網絡防禦能力

    Google DeepMind 推出有限度開放的 Fairwind Program,讓政府機構及可信賴夥伴使用進階 AI 網絡防禦能力。計劃把 Gemini 3.8 Flash Cyber 與 CodeMender 結合,用於自主發現、驗證及修復漏洞,並可在機構安全雲端環境內於數分鐘生成經驗證、可部署的修補程式。

    推薦理由:Fairwind 將 Gemini 3.8 Flash Cyber 與 CodeMender 結合,讓參與機構在安全雲端環境內生成經驗證、可部署的漏洞修補程式,將人工修補由數週縮至數分鐘。

9月2日週三
  1. Cursor Blog55

    Nokia 藉助 Cursor 在兩週內分析超過 5000 萬行程式碼

    Nokia 核心網部門表示,兩名工程師藉助 Cursor 在兩週內分析某條產品線超過 5000 萬行程式碼,無需自訂工具。分析為拆解單體架構、轉向分散式服務架構提供規劃依據,並據 Nokia 估算,數月內釋放十多名專家投入其他項目。Cursor 亦協助 Nokia 將新功能部署工作流約 80% 自動化及可視化,並把根因分析由數週縮短至數天。

  2. Sierra:Blog58

    甚麼是 Voice AI?企業級 AI 語音智能體指南

    Sierra 的企業級 Voice AI 指南説明,AI 語音智能體可結合客戶背景及業務系統,在通話中處理要求並完成工作。企業準備程度須以整通電話作端到端評估,涵蓋延遲、輪流發言、語音辨識、上下文、操作、護欄及轉接七項測試,並納入噪音、打斷、模糊請求和整合失敗等情況。Sierra 的 tau-voice 基準以 278 項客戶服務任務,結合真實音訊及重疊發言,測試對話行為與資料庫狀態是否正確。

9月1日週二
  1. Manus:Blog59

    Manus 恢復獨立營運

    Manus 宣佈已正式恢復獨立營運,創始團隊將繼續領導公司,並表示會持續推進通用 AI Agent 的發展。過渡期間,部分用户需要備份和恢復資料,並應對暫時的存取中斷。Manus 表示未來將加深與日常工作流程的整合,並更主動地代表用户採取行動。

8月31日週一
8月28日週五
8月27日週四