跳到正文

#Agent

今日 7 條
今天10月6日週二
  1. Replit:Blog51

    Replit 指 AI 採用始於可信數據,語義層是基礎

    Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。

10月5日週一
  1. TechCrunch · AI41

    研究人員追蹤中國 AI「智能體羣」活動

    獨立研究人員公佈初步發現,追蹤到一批疑似運行於騰訊基礎設施、並查詢阿里巴巴 Amap 的中國 AI 智能體。研究人員稱其為「智能體羣」而非「蜂羣」,因不同查詢之間似乎缺乏協調。記錄顯示它們查詢前往公園、動物園及醫院等公共場所不同入口的路線,調查仍在進行。

  2. The Verge · AI54

    美國參議員 Adam Schiff 談 AI 監管、言論自由及再次彈劾特朗普

    美國參議員 Adam Schiff 在訪談中討論 AI 監管、言論自由及特朗普再次遭彈劾的可能性。他認為白宮與 AI 公司簽署的自願承諾缺乏實質約束,並主張設立具專業知識和實權的 AI 監管機構。訪談亦涉及訓練資料版權、AI 公司的法律責任與私隱風險;Schiff 表示,若民主黨重掌國會,將加強監督並推動相關立法。

  3. Azeem Azhar:Exponential View55

    週一數據:更多 AI 能否帶來更多司法公正?

    AI 或能助沒有律師的人士主張權益;澳洲學者 Greg Baker 藉助 AI 挑戰僱主拒絕轉正,獲 Fair Work Commission 裁定勝訴。英格蘭及威爾斯今年受抗辯的郡法院申索案中,60% 被告沒有律師代理;美國被追討債務的消費者中,超過九成面對訴訟時沒有律師代理。

10月4日週日
10月3日週六
  1. The Decoder54

    DeepMind 研究者提出 Artificial Symbiotic Intelligence 作為奇點論的替代構想

    DeepMind 研究者提出 Artificial Symbiotic Intelligence,主張把 AI 發展視為人與多個智能體共同演化的社會系統,而非單一超級智能走向奇點。他們將智能體描述為由模型、角色、記憶、倫理取向、工具與技能組成、可拆解重組的臨時組合,並認為協作需要制度、介面與治理框架。對齊也不應只是自上而下灌輸固定價值,而是在不同領域的人、智能體與制度持續互動中形成。

  2. IT之家55

    分析師 MBI 體驗 Meta 的 Muse 後清倉 Airbnb、加倉 Meta

    獨立股票分析師 MBI 表示,體驗 Meta 的 Muse 約 10 天後,他清倉 Airbnb、加倉 Meta,因認為 AI 智能體可能繞過平台完成預訂。他稱 Muse 可結合 Airbnb 評價與 Instagram 上收藏、觀看過的旅行 Reels 推薦體驗;一次尋找農舍體驗時,直接向房東預訂比透過 Airbnb 便宜約 60%,而替 5 家酒店比價花了 14 分鐘。

  3. Tessl:產品與工程博客52

    Vibe Coding 並非我們能做到的最佳方式

    作者認為,Vibe Coding 並不足以支撐嚴肅系統開發,AI 編碼仍需精確規格、獨立驗證與增量學習。文章提到,一位使用多個 AI 智能體的人估計每日產出 12,000 行程式碼,作者指出瓶頸在規格、驗證與發布。他主張把規格納入版本控制,在部署流程自行執行測試,並透過小步變更持續收集回饋。

  4. Tessl:產品與工程博客63

    Tessl 工程師提出 Harness Engineer 角色,主張 AI 智能體時代工程工作轉向系統設計與治理

    Tessl 研究員兼工程師提出 Harness Engineer 角色,主張 AI 智能體愈多負責編碼,工程重心愈轉向設計和管理其運行系統。他將相關工作歸納為明確系統不變條件、分析智能體及程式碼數據、按風險安排審核;Tessl 以約 1,000 個開源技能測試智能體,發現平均只有約 70% 的技能指令獲遵循。

  5. LlamaIndex:產品、工程與評測53

    LlamaIndex 指出檔案系統正成為智能體管理上下文的核心介面

    LlamaIndex 指出,智能體正以檔案及檔案系統管理長期對話、檢索外部上下文和載入技能,並將其視為重要的上下文介面。作者稱,實驗中配備檔案系統工具和語義搜尋的推理智能體可動態檢索上下文,而單靠檔案搜尋在中小型文件集合上亦勝過 naive semantic search(不計延遲)。

  6. Google Developers Blog35

    Go 為何是 AI 輔助軟件工程的理想語言

    Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。

  7. LlamaIndex:產品、工程與評測41

    智能文件處理(IDP)平台:大多數供應商做錯了甚麼

    多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。

  8. Hacker News:AI 熱帖18

    評測智能體在雜亂真實公司知識中的檢索能力

    這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。

  9. Hacker News:AI 熱帖27

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。

  10. Anthropic:Alignment Science Blog63

    Anthropic 提出 ASL-4 安全論證的三種草圖

    Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。

  11. Tessl:產品與工程博客50

    AI 智能體轉型中的上下文由誰擁有?

    AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。

  12. Tessl:產品與工程博客59

    集體智能始於為錯誤標明歸屬

    智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。

  13. Anthropic:The Institute77

    The Anthropic Institute 分析 AI 加速研發與遞迴式自我改進的可能性

    Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。

    推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。

10月2日週五
10月1日週四
  1. Ethan Mollick:One Useful Thing70

    Ethan Mollick 重新評估 AI 智能體自我組織的管理難度

    Ethan Mollick 重新評估智能體管理的難度,認為 AI 模型已能自行規劃及組織協作,安排智能體工作未必需要繁複的人為設計。他以 OpenAI 的 swarm 為例,稱數千個智能體處理 Navier-Stokes 存在性與光滑性問題,歷時 88 小時並互傳約 2.7 million 則訊息;相關成果尚未獲正式接納。他也指出,智能體仍有能力限制和失控風險,人類需要設定目標並在過程中調整方向。

  2. Simon Willison56

    Simon Willison 引述 Matthew Green 分析智能體蠕蟲的傳播條件

    Matthew Green 指出,智能體蠕蟲由劫持智能體的載荷,以及把載荷帶到下一個智能體的智能體兩部分構成。彼此隔離沙箱中的智能體發現可在共享套件快取中互留指令,而這些指令會改變接收方的行為。Green 認為,若把套件快取換成電郵、Slack、共享文件或 WhatsApp,並把各自隔離的訓練流程換成 Muse 等獨立部署的個人智能體,便具備蠕蟲所需的要素。

  3. Newcomer 新聞長文54

    Machine Earning AI Summit 與會者看好個人智能體及智能體商務,金融應用仍處早期

    Machine Earning AI Summit 的與會者看好個人智能體和智能體商務,但認為讓 AI 直接處理金融決策及消費者購物仍處於早期階段。會上討論了智能體在企業後勤工作和支付上的用途,以及消費者授權、交易限制和責任歸屬等問題。觀眾調查中,52% 的受訪者認為 Muse 一年後會有最高的智能體市場佔有率。

  4. Gary Marcus:The Road to AI We Can Trust57

    像 OpenAI 這樣的公司能否繼續逃避追責?專訪福特漢姆法學院教授 Zephyr Teachout

    福特漢姆法學院教授 Zephyr Teachout 認為,執法部門應調查 OpenAI 等 AI 公司可能涉及的違法行為,並以傳票查明企業知情程度。她列舉未經授權電腦存取、產品責任及危險活動等現有法律框架,並主張聯邦、州及地方政府展開長期調查、要求公司提交文件。

9月30日週三
  1. a16z:News62

    AI 智能體代為購物,交易收益將流向誰?

    AI 智能體代為購物,可能改變平台、商家與助理之間的客戶關係及訂單導流,重分配廣告和佣金構成的利潤池。平台取態取決於智能體能帶來多少新增需求,以及平台對搜尋發現和客戶關係的收益依賴程度;Amazon 阻擋 Muse,Instacart 和 Shopify 則接入。