跳到正文

#Agent

今日 159 條
7月11日週五
  1. Mistral AI67

    Mistral AI 發佈 Devstral Medium 和升級版 Devstral Small 1.1,強化智能體編碼能力

    Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。

    推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。

7月10日週四
6月26日週四
  1. Manus:Blog58

    Manus 回顧推出後三個月的使用情況並展望後續發展

    Manus 回顧推出三個月以來的用户應用與產品改進,並提出研究、文件生成和跨應用整合等後續發展方向。為改善使用體驗,Manus 加入聊天模式和新手使用指南,並透過架構及基礎設施優化,將速度提高 2 倍、成本降低 5 倍。用户已將其用於研究、網站製作、簡報、圖像和影片生成,以及數據可視化。

6月12日週四
6月11日週三
  1. Sam Altman:Blog56

    Sam Altman談AI奇點:超級智能發展正逐步加速

    Sam Altman認為,人類已進入通往數碼超級智能的加速階段,而奇點將逐步展開。他預期2025年會出現能承擔實際認知工作的智能體,2026年可能出現能提出新見解的系統,2027年或有能執行現實任務的機械人。他主張解決對齊問題,並讓超級智能廉價、廣泛可用,避免集中於個人、公司或國家。

6月4日週三
6月3日週二
5月28日週三
5月27日週二
  1. Mistral AI70

    使用 Mistral Agents API 構建 AI 智能體

    Mistral AI 發佈 Agents API,將內置連接器、跨對話記憶及智能體編排整合為構建 AI 智能體的框架。內置連接器涵蓋代碼執行、網絡搜索、圖像生成、Document Library 及 MCP 工具;啟用網絡搜索後,Mistral Large 和 Mistral Medium 在 SimpleQA 的分數分別由 23% 和 22.08% 升至 75% 和 82.32%。

    推薦理由:Agents API 把內置連接器、跨對話記憶和多智能體編排納入同一框架,並以 SimpleQA 數據呈現網絡搜索前後的分數差異。

5月26日週一
  1. OpenAI Developers62

    o3/o4-mini 函數呼叫指南

    OpenAI 發佈 o3/o4-mini 函數呼叫指南,説明如何透過開發者提示詞、工具描述和 Responses API 改善函數呼叫表現。指南建議明確規定工具的使用邊界及呼叫次序、把參數構造規則置前,並盡可能將 `strict` 設為 `true`。

5月23日週五
5月21日週三
5月7日週三
5月1日週四
  1. AI as Normal Technology60

    AGI 並非一個里程碑

    Sayash Kapoor 認為,AGI 不是可操作的發展里程碑,因為系統能力達標不會直接帶來經濟、政策或安全影響。文章指出,AI 的經濟影響取決於產品、職場培訓、組織調整等互補條件,擴散通常以數十年計;作者亦區分模型能力與 AI 在環境中獲得的權力,主張企業及政策制定者應聚焦安全、有效的 AI 擴散,而非 AGI 宣告。

4月29日週二
4月10日週四
4月2日週三
3月18日週二
3月7日週五
  1. Mistral AI69

    Mistral OCR 推出文件理解 API,支援圖片與 PDF 解析

    Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。

    推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。

3月4日週二
  1. Mistral AI47

    Mistral AI 以智能體工作流程提升產品開發效率

    Mistral AI 的 TranscriptToPRDTicket 智能體工作流程可將會議逐字稿自動轉成產品需求文件(PRD)及開發工單。其中 PRDAgent 與 TicketCreationAgent 均由 Mistral Large 2 驅動,並可在 Linear 或 Jira 建立工單。完整實作已提供於 Google Colab notebook,供使用者開始部署及按需自訂。

2月10日週一
  1. Sam Altman:Blog62

    Sam Altman 提出 AI 經濟的三項觀察

    Sam Altman提出三項關於AI經濟的觀察,認為模型智能大致隨訓練及推理計算資源的對數增加,智能的社會經濟價值則呈超指數增長。他指出,同等 AI 水平的使用成本約每 12 個月下降 10x;以 GPT-4 於 2023 年初和 GPT-4o 於 2024 年中的每個 token 價格相比,價格約下降 150x。

2月7日週五
  1. Mistral AI75

    Mistral AI 推出全新 le Chat,面向生活與工作場景

    Mistral AI 推出全新 le Chat AI 助手,面向生活與工作場景,並開始提供 iOS、Android 版本及 Pro、Team 方案。它支援網頁搜尋、文件上傳與摘要、圖像生成及沙盒程式碼執行;Flash Answers 預覽版向所有用户開放,速度最高可達 ~1000 words / sec。

    推薦理由:le Chat 整合文件分析、Code interpreter、圖像生成與日常助理用途,並以免費、Pro、Team及企業私有部署方案覆蓋不同場景。

2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

2月3日週一
  1. OpenAI News76

    OpenAI 推出 deep research 研究智能體

    OpenAI 推出 deep research,這個智能體會運用推理整合大量網上資訊,並替用户完成多步驟研究任務。功能現時向 Pro 用户開放,Plus 和 Team 用户隨後可用。

    推薦理由:公告交代 deep research 如何處理網上資訊整合與多步驟研究任務,並列出 Pro、Plus、Team 的開放次序,方便了解其適用工作場景。

1月24日週五
  1. Hugging Face Blog62

    Hugging Face 為 smolagents 加入視覺語言模型支援

    Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。

    推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。

1月23日週四
  1. OpenAI News30

    OpenAI Operator 系統卡

    OpenAI 的 Operator 系統卡説明其多層安全方案,以及已實施的模型與產品緩解措施,用以防範提示詞工程和越獄,並保護私隱與安全。文件亦詳述外部紅隊測試、安全評估,以及持續完善相關防護措施的工作。

1月13日週一
  1. Hugging Face Blog51

    AI 智能體已經到來,Hugging Face 探討其風險與未來方向

    Hugging Face 從倫理角度分析 AI 智能體,指出自主性愈高、人類交出的控制愈多,相關風險也隨之增加,並建議不要開發完全自主的智能體。文章認為,半自主智能體的效益與風險取決於自主程度、可執行任務及人類控制方式,並梳理準確性、私隱、安全和信任等面向的取捨。作者建議建立嚴謹評估、追蹤社會影響並加強透明披露,也認為開源有助擴大參與和問責。

1月6日週一
12月31日週二
  1. Hugging Face Blog70

    Hugging Face 推出 smolagents 智能體程式庫,支援以程式碼編寫動作

    Hugging Face 推出 smolagents,讓語言模型智能體可用程式碼編寫動作。它提供以程式碼運作的 CodeAgent,也支援以 JSON/text 編寫動作的 ToolCallingAgent,並可透過 E2B 在沙盒環境執行。

    推薦理由:文章説明程式碼表達動作在組合與重用上的優勢,並展示 smolagents 仍支援 JSON/text 工具調用。

12月19日週四
  1. AI as Normal Technology69

    AI 進展是否正在放緩?

    Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。

11月20日週三
  1. Hugging Face Blog41

    BAAI FlagEval Debate:首個多語言 LLM 辯論賽讓大型模型同場辯論

    BAAI 的 FlagEval Debate 平台讓大型模型透過多語言辯論賽互相比試,以評估其推理與語言能力。平台支援中文、英文、韓文和阿拉伯文,讓模型直接交鋒,供評估者比較觀點、邏輯推理及論證策略。評估結合辯論專家評審和用户投票,並允許模型團隊調整參數、策略與對話風格。

11月18日週一
  1. Mistral AI76

    Mistral AI 為 le Chat 推出多項免費 beta 功能

    Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。

    推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。

10月16日週三
  1. Mistral AI65

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B 邊緣模型

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。

    推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。

10月10日週四
9月16日週一
  1. Hugging Face Blog67

    HuggingChat 推出 Community Tools,支援將 Hugging Face Spaces 轉為工具

    HuggingChat 推出 Community Tools,讓使用者可把 Hugging Face 上的公開 Space 轉成模型可直接調用的工具。這些工具可用於理解圖片、生成影片或文字轉語音,也可建立文件 RAG 工具。建立助手時最多可選 3 個工具;該功能目前仍屬實驗階段。

    推薦理由:文章展示如何把公開 Space、自建 Gradio 工具和文件 RAG 接入 HuggingChat,並在助手中組合最多 3 個工具,提供從建立到配置的實操路徑。

8月7日週三
7月23日週二
  1. Hugging Face Blog87

    Meta 發佈 Llama 3.1,推出 8B、70B、405B 模型並支援多語言與 128K tokens 上下文

    Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。

    推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。

6月5日週三
5月29日週三