跳到正文

#Agent

今日 35 條
8月31日週一
8月28日週五
8月27日週四
8月26日週三
8月25日週二
  1. Hugging Face Blog62

    Granite 4.2 大語言模型如何構建

    IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。

    推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。

8月21日週五
  1. Amazon Science64

    Amazon 發佈 SOP-Bench 基準,評估 AI 智能體執行真實業務程序的能力

    Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。

  2. Hugging Face Blog63

    Hugging Face Inference Endpoints、Jobs 和 Buckets 如何支撐 Papers with Code 搜尋

    Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。

    推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。

8月20日週四
  1. Mistral AI68

    Mistral 推出 Agentic Search,以多步檢索提升準確率並降低延遲和 token 使用量

    Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。

    推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。

8月19日週三
8月15日週六
8月14日週五
  1. Cursor Blog55

    Firetiger 團隊加入 Cursor,推進編碼智能體與上線後監控協同

    Firetiger 團隊將加入 Cursor,其智能體可監控軟件發布、發現回歸、調查事件,並把發現反饋給編程智能體。Cursor 表示,雙方會讓這些系統更緊密協同,使智能體能交付變更、觀察其表現,並在問題出現時響應。相關工作還包括為智能體時代打造的 Git forge Cursor Origin,以及即將推出、會監控已部署變更並在問題出現時標記的 Change Monitors。

8月13日週四
  1. Cursor Blog66

    Cursor 推出「構建」功能,雲端智能體啟動速度最快提升至 3 倍

    Cursor 推出「構建」功能,透過預先準備好的開發環境,讓雲端智能體啟動速度最快提升至 3 倍,且不額外收費。預設每小時建立新構建,成功版本會成為後續智能體的啟動環境;新構建失敗時,智能體仍使用上一次成功版本。從 8 月 17 日起,所有新建及現有環境將預設啟用構建。

  2. Cursor Blog54

    Cursor 獲得 AIUC-1 智能體安全與可靠性認證

    Cursor 宣佈已取得 AIUC-1 認證,該認證結合組織控制措施審計與產品智能體的對抗性測試。經兩輪、數千個場景測試,Cursor 的 IDE 和雲端智能體防護措施符合要求,並在正常及對抗性條件下保持有效。維持認證須至少每季接受一次測試、每年進行一次全面審計;報告可經 trust.cursor.com 信任門户取得。

  3. OpenAI News18

    GPT-5.6 建構者指南

    OpenAI 的 GPT-5.6 建構指南聚焦初創公司如何運用 GPT-5.6,更快、更具成本效益地構建 AI 智能體。指南亦涵蓋更智能的模型選擇,以及 Responses API 的新能力。

8月12日週三
  1. Google Research68

    Google Research 推進 AMIE 邁向專家級視聽臨牀會診

    Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。

    推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。

8月11日週二
8月10日週一
  1. Hugging Face Blog77

    Meta 發佈 Muse Glimmer 30B 多模態模型,採用 Apache 2.0 授權並面向本地智能體應用

    Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。

    推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。

8月7日週五
8月5日週三
  1. AI as Normal Technology62

    AI 智能體尚未能進行開放式 AI 研究

    研究團隊以兩篇未公開 AI 論文的研究問題測試前沿 AI 智能體,提供數千美元的 API 額度及算力和 6 天時間,兩篇智能體論文均遭原作者明確否決。團隊分析逾百小時的執行記錄後,指出智能體缺乏開放式研究所需的判斷力,亦未能有效運用資源、回應反饋、回退或遵循具體指示。作者表示研究僅涵蓋兩篇論文,結果仍屬初步,並計劃定期進行「shadow evaluations」以持續評估。

8月3日週一
  1. Manus:Blog54

    Manus 上線 ElevenLabs 連接器,支援對話生成語音、轉錄錄音及構建語音應用

    Manus 上線 ElevenLabs 連接器,讓用户可在對話中生成語音、轉錄錄音、克隆聲音及構建語音應用。用户須連接有效的 ElevenLabs 帳户;Manus 透過 ElevenLabs API 處理音訊,功能可用性取決於套餐和積分餘額。音訊資料按 ElevenLabs 的資料保留政策處理,生成與計費仍由 ElevenLabs 管理。

7月31日週五
7月30日週四
  1. Google DeepMind66

    Google DeepMind 發佈 Gemini Robotics ER 2,支援影片理解、任務編排與多機械人協作

    Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。

    推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。

  2. Cursor Blog69

    Cursor 如何搭建雲端智能體環境

    Cursor 分享了為雲端智能體搭建開發環境的方法,讓雲端 VM 貼近本地開發,並支援智能體測試程式碼及維護環境。團隊以 Dockerfile 配置依賴,以 anydev 簡化服務啟動,並透過 Cursor Cloud MCP 和 Cloud Doctor 診斷、修復環境及改善工作流。去年 12 月,合併到 Cursor 單體倉庫的 PR 中約十分之一由雲端智能體編寫,如今已超過一半。

7月29日週三
7月28日週二
  1. Google DeepMind69

    Gemini Robotics 2 為機械人帶來全身智能控制

    Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。

    推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。

7月27日週一
  1. elsewhere:文章47

    11 年、110 億美元,然後呢?|對話 Airwallex 吳愷:AI 時代,下一站估值 1,000 億美元

    Airwallex 首席營收官吳愷在「十字路口」對談中回顧公司用 11 年從 0 發展至 110 億美元估值,並探討 AI 對科技金融的改變及公司邁向 1,000 億美元估值的路徑。Airwallex 的 ARR 約 13 億美元、年增速約 74%,現有 20 多萬客户。對談亦涵蓋 Kai、AgentOS、T:0、Airi 等產品,以及收購 Leapfin、OpenPay 的考量。

7月24日週五