Replit 透過 GPT-5.6 Luna 擴大軟件創作入口
Replit 透過由 GPT-5.6 Luna 驅動的 Free Mode 擴大軟件創作入口。Free Mode 讓任何人把想法轉化為可運作的軟件,並稱毋須擔心 token 費用。
AI 寫代碼的一切:編碼助手、Vibe Coding、代碼模型評測與開發工作流變革。
Replit 透過由 GPT-5.6 Luna 驅動的 Free Mode 擴大軟件創作入口。Free Mode 讓任何人把想法轉化為可運作的軟件,並稱毋須擔心 token 費用。
SpaceX 已正式完成對 Cursor 的收購,結束始於 4 月的收購流程。雙方當時宣佈合作以加速模型訓練;Cursor 表示,與 SpaceX 攜手後可使用全球最大的 GPU 集羣,打造更強且運行成本更低的模型。Cursor 稱,星期三發布的 Grok 4.6 初步展示雙方共同打造的成果,並表示 Cursor 將成為讓這類智能發揮實用價值的場域之一。
推薦理由:這則消息把 Cursor 的收購與模型建設所需算力、降低成本的計劃放在同一脈絡中,Grok 4.6 被列作初步成果。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
Samsung Electronics 向全球員工部署 ChatGPT Enterprise 和 Codex。OpenAI 稱,這是其規模最大的企業 AI 部署之一。
推薦理由:這則公告提供企業級 AI 落地的具體案例,交代 Samsung Electronics 面向全球員工部署的產品,也呈現 OpenAI 對此次部署規模的定位。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
OpenAI 計劃收購 Ona,以安全、持久的雲端環境擴展 Codex。此舉將支援 AI 智能體在企業工作流程中長時間運行。
推薦理由:這宗收購把雲端環境與 Codex 的擴展連結起來,可從中瞭解 OpenAI 如何將長時間運行的 AI 智能體延伸至企業工作流程。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。
Mistral 推出 Mistral Medium 3.5 公開預覽,並以此支援 Mistral Vibe 雲端遠端編碼代理及 Le Chat 的 Work mode。
推薦理由:材料展示模型、雲端編碼代理與 Le Chat 多步驟工具流程的連接方式,能看出長程任務如何落入具體產品工作流。
Google Research 開放 ERA 科學研究工具,並開始逐步開放由 ERA 與 AlphaEvolve 構建的 Computational Discovery。
推薦理由:文章把 ERA 的樹狀搜尋方法與多學科基準和實際科學問題並置,呈現其從程式碼優化延伸至預測研究的應用範圍。
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
OpenAI 讓用户透過 ChatGPT 手機應用程式跨裝置及遠端環境使用 Codex。用户可即時監看、調整及核准編碼任務。
推薦理由:這項更新把 Codex 編碼任務的監看、調整與核准延伸至 ChatGPT 手機應用程式,讓相關操作可跨裝置及遠端環境進行。
OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。
推薦理由:文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。
Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。
推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。
OpenAI 的 GPT models、Codex 與 Managed Agents 現已在 AWS 提供。OpenAI 表示,企業可在 AWS 環境建構安全 AI。
推薦理由:這項 AWS 上線交代了 OpenAI GPT models、Codex 與 Managed Agents 的可用範圍,也説明企業可在 AWS 環境建構安全 AI 的使用場景。
Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。
推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。
OpenAI 推出 Codex Labs,並與 Accenture、PwC、Infosys 等合作,協助企業在整個軟件開發生命週期部署和擴展 Codex。Codex 的 WAU 達到 4M。
推薦理由:Codex Labs 將企業部署覆蓋至整個軟件開發生命週期,合作夥伴與 4M WAU 分別呈現落地方式和使用規模。