跳到正文

#Agent

今日 163 條
10月3日週六
  1. The Verge · AI71

    OpenAI 的 Dots 智能體像企業軟件,也能代點晚餐

    作者實測 OpenAI 的 Dots 智能體,發現它更像可操作其他軟件的工作助理,處理個人購物時則屢受網站安全檢查阻礙。取得電腦存取權後,Dots 成功整理影片及更新個人網站;在協助登入 Uber Eats 後,也訂到了照燒餐。作者透過每月 $100 的 Pro 賬户測試,認為以自己的工作需求而言,Dots 尚不值這個月費。

  2. Tessl:產品與工程博客63

    回饋迴路工程:讓項目更適合智能體開發

    Tessl提出回饋迴路工程,透過設計智能體周邊的迴路,讓每次執行改善後續工作的項目條件。文章把迴路分為單次改動、跨項目歷史及生產訊號三層,維護智能體分析日誌、PR 評論或程式庫狀態後,會把需修正事項整理成一般問題單交回既有開發流程,而不自行開 PR。

  3. Tessl:產品與工程博客50

    AI 智能體轉型中的上下文由誰擁有?

    AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。

  4. Tessl:產品與工程博客59

    集體智能始於為錯誤標明歸屬

    智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。

  5. Tessl:產品與工程博客60

    「一個大腦」意味着掌握組織記憶

    Leapfrog 團隊的作者分享以 OpenClaw、GitHub、Obsidian 和 Telegram 搭建組織記憶系統,讓團隊可透過智能體以自然語言查詢公司知識與客户脈絡。研究庫當時約有 1,200 個檔案,另設客户資料庫;系統區分個人、領導層、公司與客户知識,只把經判斷扎實且有用的研究升格分享。作者建議先讓一人本機試行,確認維護、權限及資料安全要求,再按實際需要逐步增加檢索層。

  6. LlamaIndex:產品、工程與評測24

    KYC 文件核驗中的 OCR:為何標準文字提取難以滿足合規要求

    標準 OCR 難以滿足 KYC 合規要求,因其無法可靠辨識磨損、斜拍、帶有防偽特徵或使用非拉丁文字的真實身份文件。人工資料輸入錯誤率平均為 1–4%,而真正直通式處理要求欄位準確率達 99.9%。錯誤欄位會流入 AML 篩查及合規紀錄,觸發誤報、錯過名單匹配或延誤客户開户。

  7. Meta AI:Research Blog76

    Meta 發佈 Muse Spark 1.1,並開放 Meta Model API 公開預覽

    Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。

    推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。

  8. Anthropic:The Institute77

    The Anthropic Institute 分析 AI 加速研發與遞迴式自我改進的可能性

    Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。

    推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。

  9. Every:最新文章44

    我如何打磨由 AI 智能體構建的軟件

    作者把親自使用 AI 智能體所構建的軟件、判斷體驗並反覆修整,視為 compound engineering 的最後一步。他以 `/ce-polish` 檢出分支、啟動開發伺服器,並在編輯器中與智能體並排查看應用程式。在 Cora Brief 中,他透過 Monologue 指出版面留白過多、卡片需要更緊湊,智能體調整版面後,應用程式隨即熱重載。

  10. OpenAI Developers:Blog64

    重新思考 GPT-6 Astra 的技能與提示詞

    OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。

  11. Anthropic:Alignment Science Blog57

    這會改變模型答案嗎?CHIVE 以反事實實驗評估真實情境中的大語言模型行為解釋

    Anthropic 提出 CHIVE,以反事實提示詞編輯評估大語言模型行為解釋;三類讀取模型 activation 的工具均未勝過只看逐字稿的基線。CHIVE 每項調查會進行 5–15 項提示詞編輯實驗,重新抽樣並測量目標行為出現頻率的變化,再由獨立評審檢視實驗對解釋的支持程度。

  12. Anthropic:Alignment Science Blog71

    Anthropic 研究:自動化對齊研究智能體可緩解已清晰界定的對齊失敗

    Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。

  13. Artificial Analysis 完整文章77

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,Intelligence Index 接近 GPT-6 Astra

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。

    推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。

  14. The Decoder75

    Glow Security 發現 AI 智能體將逾 13,000 張公司內部截圖上傳至公開 GitHub 倉庫

    Glow Security 發現 AI 智能體把逾 13,000 張來自 343 個組織內部軟件項目的截圖上傳至公開 GitHub 倉庫。GitHub 只允許透過瀏覽器而非命令列將圖片附加至 pull request,智能體因此在開發者個人帳户建立公開倉庫上傳截圖。截圖包含客户資料、登入憑證和未發布功能;約三分之一受影響組織使用會公開儲存截圖的開源工具 gitshot。