跳到正文

#編碼

今日 41 條
6月26日週五
6月22日週一
6月17日週三
  1. Hugging Face Blog78

    GLM-5.2 發佈,最大上下文擴至 1M tokens並提升長程任務能力

    GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。

    推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。

6月11日週四
  1. AI as Normal Technology72

    為何 AI 尚未取代軟件工程師,未來也不會

    文章認為,AI 尚未取代軟件工程師,單靠能力提升也不會消除這類工作的需求。作者以「決策、執行、交付」三層框架解釋,AI 壓縮程式碼實作的執行層,但需求界定、驗證及交付責任仍需人員承擔。一項涵蓋 GitHub 上 100,000 名開發者的研究顯示,AI 智能體令程式碼行數增加 8 倍,發布量只增加 30%。

  2. Factory 研究 / 產品66

    Droid 推出自動化安全審查功能

    Factory 為 Droid 推出自動化安全審查,在每個非草稿 PR 中與標準程式碼審查同步執行 STRIDE 審查。結果會以 diff 行內評論列出嚴重程度、CWE 參照、説明及建議修正;Droid 會對照 diff 驗證候選發現,以過濾誤報。功能現已適用於所有方案;Droid CLI / Desktop App 可設定審查,亦可在本機工作階段按需審查整個程式碼庫或目前 diff。

6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

6月9日週二
6月1日週一
5月29日週五
5月28日週四
  1. Mistral AI76

    Mistral AI 推出 Vibe,整合工作任務與程式開發

    Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。

    推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。

5月27日週三
5月22日週五
5月20日週三
5月18日週一
5月16日週六
5月15日週五
5月14日週四
5月13日週三
5月12日週二
5月11日週一
  1. Manus:Blog51

    如何用 Manus Website Builder 的 Make a Copy 複製 WebDev 項目

    Manus Website Builder 的 Make a Copy 功能可將現有 WebDev 項目複製到新的獨立工作階段,讓用户在不影響原項目的情況下修改和測試。副本會保留最新檢查點或提交的完整程式碼庫、資料庫結構及密鑰和值,並只帶入簡短對話摘要。資料庫資料行、自訂網域設定和 GitHub 連線不會轉移,副本初始狀態為未發佈。

5月8日週五
5月7日週四
5月6日週三
5月4日週一
5月1日週五
  1. OpenAI:失準報告與通報76

    OpenAI 説明 Auto-review 如何在無同步人工監督下審核 Codex 越界操作

    OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。

    推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。

4月30日週四
4月29日週三
  1. Hugging Face Blog61

    Granite 4.1 LLM 如何構建:預訓練、微調與強化學習流程

    Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。

    推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。

4月28日週二
4月23日週四
  1. Hugging Face Blog62

    如何在 Chrome 擴充功能中使用 Transformers.js:Manifest V3 架構指南

    Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。

    推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。