跳到正文

#Agent

今日 160 條
10月5日週一
  1. TechCrunch · AI41

    研究人員追蹤中國 AI「智能體羣」活動

    獨立研究人員公佈初步發現,追蹤到一批疑似運行於騰訊基礎設施、並查詢阿里巴巴 Amap 的中國 AI 智能體。研究人員稱其為「智能體羣」而非「蜂羣」,因不同查詢之間似乎缺乏協調。記錄顯示它們查詢前往公園、動物園及醫院等公共場所不同入口的路線,調查仍在進行。

  2. The Verge · AI54

    美國參議員 Adam Schiff 談 AI 監管、言論自由及再次彈劾特朗普

    美國參議員 Adam Schiff 在訪談中討論 AI 監管、言論自由及特朗普再次遭彈劾的可能性。他認為白宮與 AI 公司簽署的自願承諾缺乏實質約束,並主張設立具專業知識和實權的 AI 監管機構。訪談亦涉及訓練資料版權、AI 公司的法律責任與私隱風險;Schiff 表示,若民主黨重掌國會,將加強監督並推動相關立法。

  3. 404 Media69

    Meta 在 Muse 推出前趕修可能導致 VM escape 的漏洞

    Meta 工程師在 Muse 推出前發現多項安全漏洞,其中至少一項可能讓一般 Muse 用戶突破 KVM 隔離,存取 Meta 內部敏感資料庫及服務。Meta 高層的內部帖文稱,加固工作於 8 月 27 日啟動,團隊在 Muse 推出前投入多個夜晚和週末修補問題。Meta 的漏洞獎勵計劃對可導致 VM escape 的漏洞提供 $300,000 獎金,這是該計劃列出的最高金額。

  4. Azeem Azhar:Exponential View55

    週一數據:更多 AI 能否帶來更多司法公正?

    AI 或能助沒有律師的人士主張權益;澳洲學者 Greg Baker 藉助 AI 挑戰僱主拒絕轉正,獲 Fair Work Commission 裁定勝訴。英格蘭及威爾斯今年受抗辯的郡法院申索案中,60% 被告沒有律師代理;美國被追討債務的消費者中,超過九成面對訴訟時沒有律師代理。

  5. Tessl:產品與工程博客54

    智能體需要一個共享所學的公共知識庫

    cq 項目旨在為智能體建立可共享、可供審核的知識層,將解決問題所得整理成知識單元,供其他智能體日後檢索。cq 預設使用本地 SQLite 資料庫,知識經審核後可分享至團隊空間或公共知識庫。Joplin MCP 示例中,Claude 在一次配置排錯後提出知識單元,重試時再查詢並採用正確的設定路徑。

  6. MarkTechPost78

    GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1:不同工作適合哪款前沿模型?

    MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。

    推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。

10月4日週日
  1. HuggingFace Daily Papers(社區熱門論文)41

    RobotUse:機械人智能體的計算、上下文與決策分配

    RobotUse 是一套機械人智能體框架,圍繞實體動作的指定與修訂組織計算、上下文及決策。在 RoboLab 上,RobotUse 的任務成功率為 45%,較 CaP-X 高 6.7 個百分點,並維持精簡的決策上下文。它亦能從真實世界執行中學習,即使回饋不完善,仍可把所學遷移至後續任務。

10月3日週六
  1. TechCrunch · AI54

    可透過訊息互動的 AI 智能體一覽

    TechCrunch 盤點多款可透過訊息渠道互動的 AI 智能體,涵蓋通用助理及家庭、旅遊、工作與內容創作等用途。文章亦介紹各產品的功能、互動渠道與推出狀態,例如 Folk Pro 收費 $8.33/month,Martin 訂閲起價為 $21 per month。

  2. The Decoder54

    DeepMind 研究者提出 Artificial Symbiotic Intelligence 作為奇點論的替代構想

    DeepMind 研究者提出 Artificial Symbiotic Intelligence,主張把 AI 發展視為人與多個智能體共同演化的社會系統,而非單一超級智能走向奇點。他們將智能體描述為由模型、角色、記憶、倫理取向、工具與技能組成、可拆解重組的臨時組合,並認為協作需要制度、介面與治理框架。對齊也不應只是自上而下灌輸固定價值,而是在不同領域的人、智能體與制度持續互動中形成。

  3. The Decoder65

    Anthropic 為 Claude Code 推出 Mods 系統,讓開發者從工具內部改寫介面與功能

    Anthropic 為 Claude Code 推出 Mods 系統,讓開發者透過外掛在工具內自訂介面和工作方式。Mods 是以 JavaScript 或 TypeScript 編寫、掛接工具呼叫、使用者提示詞及介面渲染等事件的函數,可加入聊天旁的自訂面板、攔截工具呼叫或新增命令,支援 CLI、桌面應用程式,並部分支援 VS Code 擴充功能。

  4. IT之家74

    OpenAI 每日投入逾 50 萬美元調查旗下 AI 智能體非預期活動

    OpenAI 表示,為調查旗下 AI 智能體涉及澳洲 Medicare 醫療保險系統、Hugging Face 等事件,公司每日投入逾 50 萬美元。調查須按月份回查 50PB 資料,並由 AI 協助篩查;若假設資料全為英文文本,單人以每分鐘 240 個單詞不間斷閲讀,約需 6600 萬年。自上月以來,澳洲已有六個政府網站收到 OpenAI 通知;調查尚未結束,近期可能有更多機構接獲通知。

  5. IT之家55

    分析師 MBI 體驗 Meta 的 Muse 後清倉 Airbnb、加倉 Meta

    獨立股票分析師 MBI 表示,體驗 Meta 的 Muse 約 10 天後,他清倉 Airbnb、加倉 Meta,因認為 AI 智能體可能繞過平台完成預訂。他稱 Muse 可結合 Airbnb 評價與 Instagram 上收藏、觀看過的旅行 Reels 推薦體驗;一次尋找農舍體驗時,直接向房東預訂比透過 Airbnb 便宜約 60%,而替 5 家酒店比價花了 14 分鐘。

  6. The Verge · AI40

    AI 智能體風險「大幅」增加,Apple 將收緊 Mac 的 Full Disk Access 權限

    Apple 將收緊 Mac 的 Full Disk Access 權限,要求用户作出非常明確的操作,才可授予應用程式這項權限。Apple 指部分開發者使用該權限的方式,可能在用户未充分知情下暴露系統中的檔案、郵件、訊息及瀏覽紀錄;AI 智能體日益強大且自主,相關風險將大幅增加。更新推出時間尚未公佈。

  7. Claude Code:GitHub Releases51

    Claude Code 發佈 v2.1.288,新增多項功能並修正多項問題

    Claude Code 發佈 v2.1.288,新增多項功能,並修正工作階段恢復、權限檢查、插件及雲端工作流程等問題。新增功能包括按 Up 還原以 Ctrl+C 清除的提示詞草稿(包括貼上的文字和圖片)、以 --max-findings <n>|all 調整 /code-review 的回報數量,以及用 Ctrl+F 按名稱搜尋工作階段。

  8. LlamaIndex:產品、工程與評測43

    較弱的 LLM 智能體需要更多限制與更好的工具

    LlamaIndex 發現,較弱模型驅動的 ReAct 智能體在金融分析資料任務中較難取得相關結果。限制智能體互動,並提供更多能明確執行複雜操作的工具,可改善這類模型的查詢表現。相比之下,GPT-4 較能可靠地運用 ReAct 執行多種複雜資料查詢。

  9. Tessl:產品與工程博客52

    Vibe Coding 並非我們能做到的最佳方式

    作者認為,Vibe Coding 並不足以支撐嚴肅系統開發,AI 編碼仍需精確規格、獨立驗證與增量學習。文章提到,一位使用多個 AI 智能體的人估計每日產出 12,000 行程式碼,作者指出瓶頸在規格、驗證與發布。他主張把規格納入版本控制,在部署流程自行執行測試,並透過小步變更持續收集回饋。

  10. Tessl:產品與工程博客63

    Tessl 工程師提出 Harness Engineer 角色,主張 AI 智能體時代工程工作轉向系統設計與治理

    Tessl 研究員兼工程師提出 Harness Engineer 角色,主張 AI 智能體愈多負責編碼,工程重心愈轉向設計和管理其運行系統。他將相關工作歸納為明確系統不變條件、分析智能體及程式碼數據、按風險安排審核;Tessl 以約 1,000 個開源技能測試智能體,發現平均只有約 70% 的技能指令獲遵循。