跳到正文

#Agent

今日 163 條
10月1日週四
  1. Gary Marcus:The Road to AI We Can Trust57

    像 OpenAI 這樣的公司能否繼續逃避追責?專訪福特漢姆法學院教授 Zephyr Teachout

    福特漢姆法學院教授 Zephyr Teachout 認為,執法部門應調查 OpenAI 等 AI 公司可能涉及的違法行為,並以傳票查明企業知情程度。她列舉未經授權電腦存取、產品責任及危險活動等現有法律框架,並主張聯邦、州及地方政府展開長期調查、要求公司提交文件。

9月30日週三
  1. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 正式開放使用,面向智能體編碼與專業工作負載

    GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。

    推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。

  2. Sierra:Blog49

    Sierra 加入 OpenAI Marketplace

    Sierra 成為 OpenAI 新 B2B Marketplace 的首發合作夥伴,合資格客戶可將既有 OpenAI 承諾額度用於與 Sierra 建立智能體。Sierra 按業務成果而非 tokens 計費,Ghostwriter 支援團隊建立、部署及改進智能體。

  3. a16z:News62

    AI 智能體代為購物,交易收益將流向誰?

    AI 智能體代為購物,可能改變平台、商家與助理之間的客戶關係及訂單導流,重分配廣告和佣金構成的利潤池。平台取態取決於智能體能帶來多少新增需求,以及平台對搜尋發現和客戶關係的收益依賴程度;Amazon 阻擋 Muse,Instacart 和 Shopify 則接入。

  4. AWS Machine Learning Blog51

    Amazon Quick 提示詞工程基礎:通用原則與結構化框架

    AWS 介紹 Amazon Quick 的提示詞工程基礎,整理適用於不同功能的通用原則與可複用框架。文章涵蓋明確具體、提供業務背景、以示例指定輸出,以及 CRISPE、RADAR、ARCHITECT 和 QUEST 等框架,並介紹中繼資料檢索、多角度分析與情境規劃。文中以 RFI 問卷自動化示範 Quick Flow 如何把多工作表資料整理為四欄 CSV,並稱可將原需數小時的處理縮至數分鐘。

9月29日週二
  1. Simon Willison84

    OpenAI DevDay 2026 即時紀錄:發佈 GPT-6.1 Sol、Dots 等產品與功能

    OpenAI 在 DevDay 2026 發佈 GPT-6.1 Sol、Dots 智能體及多項開發者工具與功能。GPT-6.1 Sol 主打接近 Astra 的智能水平,價格為 Astra 的五分之一;Ultrafast 最高達 300 tokens/second,速度快 8x,先支援 Astra 6。

    推薦理由:現場紀錄同時追蹤產品宣佈、示範失誤與後續功能場次,讀者可從發佈內容和實際操作兩方面瞭解 OpenAI DevDay 的產品進展。

  2. Pragmatic Engineer68

    Shopify 為何放棄 React Native、轉向原生開發?

    Shopify 決定藉助 AI 智能體,把所有流動應用由 React Native 遷移至 Swift 和 Kotlin,理由是 AI 已降低為 iOS、Android 分別實作功能的成本。Shop app 已在 12 週內以原生方式推出,Shopify app 正在遷移;團隊以共用測試套件驗證兩平台的商業邏輯,功能須通過相同測試才能發佈。

  3. Meta:Newsroom · AI60

    Meta 擴展 Muse,加入面向小型企業的新技能與連接器

    Meta 擴展 AI 智能體 Muse,加入協助小型企業營運的新技能和連接器。它可連接 Instagram 專業帳戶的分析數據、Facebook 專頁、Meta 廣告帳戶及多種業務工具,並支援自訂連接器;合作夥伴可透過 muse.ai/platform 申請。Meta 列出的用途包括分析銷售與廣告成效、草擬營銷活動及檢查財務表現;Muse 大部分所需功能免費,亦提供訂閲計劃。

  4. elsewhere:文章64

    Manus 2.0 面向海外用户發佈,推出生活助理 Cue

    Manus 於 9 月 28 日面向海外用户發佈 2.0 版本,並推出面向個人生活場景的智能助理 Cue。Cue 中每個 Agent 可擁有自己的電郵、電話號碼、錢包和電腦,代表用户與現實中的服務互動,多個 Agent 亦可在同一羣聊中協助掃碼點餐、排隊取號。

  5. Google AI:DEV 作者專屬58

    如何使用 Gemini Live API 建立即時語音 AI 智能體

    Gemini Live API 可用於建立即時語音 AI 智能體,透過雙向 WebSocket 同時傳送和接收音訊,支援即時回應及用戶插話。建議並行處理麥克風上行音訊與模型下行語音,並在麥克風偵測到用戶説話時立即靜音及清除播放緩衝區;Gemini Live 內置 VAD 負責偵測語音活動。工具操作可非同步執行並即時回傳確認,避免較慢的外部操作令語音生成停頓。

  6. Google AI:DEV 作者專屬62

    如何在生產環境中加固 AI 智能體沙盒:Docker 容器以外的 7 種方法

    文章提出 7 種在生產環境加固 AI 智能體沙盒的方法,並指出標準 Docker 容器共用主機作業系統核心。建議採用 gVisor 或 microVM 作核心隔離,把 API 金鑰留在沙盒外並透過閘道呼叫,預設限制所有階段的外連,並按整個工作階段累計工具操作及預算。其餘措施包括隔離工作區並保護 CI/測試檔案、使用按活躍 CPU 計費的無伺服器環境,以及把審計日誌即時傳送至沙盒外。

  7. MIT Technology Review · AI60

    AI 何時才算作出科學發現?Anthropic 生物學案例引發判準爭議

    Anthropic 將 Claude 智能體找到的生物學模式稱作一項發現,但生物學家質疑僅識別模式是否足以構成科學發現。Anthropic 稱 950 個智能體經 21 小時在已知酶周邊找出此前未編目的重複模式;Mario Rodríguez Mestre 則表示其團隊早已發現該模式,Anthropic 否認從他與 Claude 的對話中得知。

  8. Manus:Blog62

    Manus 推出 Manus Flex,讓用户在工作區使用自有 API 密鑰

    Manus 推出 Manus Flex,讓用户在 Manus 工作區使用受支持推理服務商的自有 API 密鑰驅動 Manus。Manus 仍提供負責規劃工作、使用工具及跨執行環境運行的 Agent 系統,首批推理合作夥伴為 OpenRouter、Fireworks 和 Modal。模型推理費由服務商直接計費,任務使用的其他服務和基礎設施則消耗 Manus 積分。

9月28日週一
  1. Recode China AI75

    Meta 的 Muse 為何令中國科技公司高度警惕

    Meta 推出個人智能體應用 Muse 後迅速走紅,作者認為,個人智能體浪潮可能讓擁有完整產品生態的中國科技巨頭受惠。據 Bloomberg,Muse 推出後 6 天下載量超過 902,000 次;推出 10 天後登上美國 iPhone App Store 免費榜首,Meta 股價截至 9 月 24 日上升逾 25%。

  2. Anthropic:Claude.dev 開發者博客80

    Claude Sonnet 5.5 開發指南:API 接入、遷移與調校

    Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。

    推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。

  3. Hugging Face Blog70

    Holo4 發佈通用電腦操作智能體模型系列

    H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。

    推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。

  4. elsewhere:文章59

    個人主義才能救 AI

    葬AI主張,AI 產品應從提升職場生產力轉向服務個人生活,讓 Personal agent 回應一般用户的實際需求。文章實測 Today.ai 與 Grok bot,用於整理旅行行程、近1000條旅遊影片、衣物搭配及網絡內容;Today.ai 亦能從 Gmail 和 Notion 搜尋行程線索。

  5. Hugging Face Blog55

    Hugging Face Hub 新增 RL Environments 篩選入口

    Hugging Face Hub 新增 RL Environments 篩選入口,集中展示帶有 rl-environment 標籤的資料集。資料集可標示 Harbor、Verifiers、OpenEnv、NeMo Gym 的兼容性,並在頁面提供相應的執行命令。標籤只描述兼容性,不會把檔案轉換成其他框架格式,也不會啟動 job 或 sandbox。

9月26日週六
  1. Claude Code:GitHub Releases50

    Claude Code v2.1.283 更新加入模型管控、提示詞審核及閘道負載測試

    Claude Code 發佈 v2.1.283,新增模型可用性管控、提示詞審核及閘道負載測試模式,並修正多項 MCP、插件與工作流問題。管理設定可限制可用模型版本或封鎖指定模型;/doctor prompt-audit 可檢查 CLAUDE.md、skills、agents 和 commands 中為舊模型編寫的提示詞模式。負載測試模式會建立並簽署請求,但不會發送至上游,客戶端則會收到固定回覆。