跳到正文

AI 編碼

AI 寫代碼的一切:編碼助手、Vibe Coding、代碼模型評測與開發工作流變革。

86條精選相關主題Agent 智能體Cursor教學實踐

最新精選

第 21–40 條 · 共 86 條
8月19日週三
8月14日週五
  1. Cursor Blog82

    SpaceX 正式完成對 Cursor 的收購

    SpaceX 已正式完成對 Cursor 的收購,結束始於 4 月的收購流程。雙方當時宣佈合作以加速模型訓練;Cursor 表示,與 SpaceX 攜手後可使用全球最大的 GPU 集羣,打造更強且運行成本更低的模型。Cursor 稱,星期三發布的 Grok 4.6 初步展示雙方共同打造的成果,並表示 Cursor 將成為讓這類智能發揮實用價值的場域之一。

    推薦理由:這則消息把 Cursor 的收購與模型建設所需算力、降低成本的計劃放在同一脈絡中,Grok 4.6 被列作初步成果。

7月21日週二
7月17日週五
  1. Google DeepMind65

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber 網絡安全模型

    Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。

    推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。

7月2日週四
6月22日週一
6月17日週三
  1. Hugging Face Blog78

    GLM-5.2 發佈,最大上下文擴至 1M tokens並提升長程任務能力

    GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。

    推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。

6月11日週四
6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

5月28日週四
  1. Mistral AI76

    Mistral AI 推出 Vibe,整合工作任務與程式開發

    Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。

    推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。

5月22日週五
5月20日週三
5月16日週六
5月14日週四
5月1日週五
  1. OpenAI:失準報告與通報76

    OpenAI 説明 Auto-review 如何在無同步人工監督下審核 Codex 越界操作

    OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。

    推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。

4月29日週三
  1. Hugging Face Blog61

    Granite 4.1 LLM 如何構建:預訓練、微調與強化學習流程

    Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。

    推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。

4月28日週二
4月23日週四
  1. Hugging Face Blog62

    如何在 Chrome 擴充功能中使用 Transformers.js:Manifest V3 架構指南

    Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。

    推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。

4月21日週二
  1. OpenAI News64

    OpenAI 推出 Codex Labs,拓展 Codex 企業部署

    OpenAI 推出 Codex Labs,並與 Accenture、PwC、Infosys 等合作,協助企業在整個軟件開發生命週期部署和擴展 Codex。Codex 的 WAU 達到 4M。

    推薦理由:Codex Labs 將企業部署覆蓋至整個軟件開發生命週期,合作夥伴與 4M WAU 分別呈現落地方式和使用規模。