Google 發佈 Gemini 4 Argon,稱其為迄今最強模型
Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。
Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。
原帖作者感嘆,AI 編碼普及正削弱軟件開發能力帶來的競爭優勢,也令他擔憂工程師的創作樂趣與影響力減弱。回覆者對降低製作門檻的影響看法不一,有人認為 AI 釋放創作能力,也有人憂慮內容氾濫、產品難以差異化、技能貶值和工作流失。
AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。
MIT 的 Alex Zhang 在訪談中主張,學術研究者應押注產業實驗室較少關注、初看可能微不足道或古怪的研究方向。他將 Recursive Language Models(RLMs)描述為以程式碼作為唯一工具、讓模型可以遞迴調用自身,並在程式環境中保存上下文的 harness。
Claude Code 發佈 v2.1.287,新增 Claude Mods,讓插件可修改更深層行為,並加入內置的 You should know mod。You should know 會由側邊智能體提醒用戶和 Claude 可能忽略的事項。
GitHub Blog 作者挑選了 GitHub Universe 2026 的 10 場技術演講,涵蓋 AI 智能體記憶、評測、權限及生成程式碼驗證。其他主題包括 npm 依賴項與供應鏈安全、JavaScript 工具鏈,以及在網絡連線不穩定環境下開發軟件。
這篇指南示範如何從空資料夾建立 Claude Code mod,並以約 80 行的 Token Weather 在提示詞上方顯示上下文窗口用量的即時預報。
Google DeepMind 推出 Gemini 4 Argon,面向編碼、企業知識工作及網絡安全防禦,支援最高 1M output tokens。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
Claude Code 發佈 v2.1.286,新增 VS Code 書籤和問題卡片選項預覽等功能,並修正多項使用問題。修正項目涉及並行工具呼叫後的會話恢復、MCP 認證和連接器、Remote Control,以及雲端工作階段。
Gergely Orosz 訪問 Cockroach Labs 聯合創辦人兼 CTO Peter Mattis,討論分佈式數據庫、存儲系統設計及 AI 對軟件工程工作的影響。
Manus 2.0 推出 Game Dev,讓沒有編程經驗的人可用 AI 製作並打磨自己喜愛的遊戲。它會為遊戲生成專屬調參面板,讓用户遊玩時即時調整速度、重力、傷害和生成頻率,並可管理、替換及用 AI 編輯素材。Game Dev 亦協助處理多人遊戲的伺服器及部署等複雜工作,讓更多玩家可同時加入遊戲。
Anthropic 為 Claude Code 的 claude-api plugin 加入 build_eval 和 hill-climb 指令,協助建立評測、檢查評分器並改進應用程式。
Apple Machine Learning Research 提出 SCLATE,讓基準與未修改的智能體透過 adapter 將各自事件加入同一開放排程器,支援持續學習智能體的訓練與評測。
Factory 宣佈 Automations 即日起向所有用戶開放,Droid 可按排程或事件觸發執行重複工作流程。用戶可為每項自動化設定提示詞或範本、模型及推理程度,並選擇在本機、已連接的電腦或 Factory 管理的 Droid Computer 上執行。
GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。
推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。
NVIDIA TensorRT Model Connect 是一個面向編碼智能體設計、基於 NVIDIA TensorRT 建構的開源 C++ AI 模型參考實作集合。其開發經驗包括並行工作、模型家族隔離、可逆變更,以及 GPU 支援的驗證。
OpenAI 在 DevDay 2026 發佈 GPT-6.1 Sol、Dots 智能體及多項開發者工具與功能。GPT-6.1 Sol 主打接近 Astra 的智能水平,價格為 Astra 的五分之一;Ultrafast 最高達 300 tokens/second,速度快 8x,先支援 Astra 6。
推薦理由:現場紀錄同時追蹤產品宣佈、示範失誤與後續功能場次,讀者可從發佈內容和實際操作兩方面瞭解 OpenAI DevDay 的產品進展。
Shopify 決定藉助 AI 智能體,把所有流動應用由 React Native 遷移至 Swift 和 Kotlin,理由是 AI 已降低為 iOS、Android 分別實作功能的成本。Shop app 已在 12 週內以原生方式推出,Shopify app 正在遷移;團隊以共用測試套件驗證兩平台的商業邏輯,功能須通過相同測試才能發佈。
OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。
推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。
Anthropic 推出 Claude Sonnet 5.5,官方稱其運行速度提升 30% 以上,對大多數工作最多便宜 30%。作者表示其定價與 Sonnet 5 相同,並觀察到它在所有基準測試上似乎都勝過 Sonnet 5,在部分編碼任務上接近 Opus 5.5。
GitHub Security Lab 使用開源 AI 安全 Agent 審計 Android 應用程式,至今已找出並回報 24 個漏洞。作者透過區分流動與非流動入口、按入口類型指定漏洞檢查,並結合嚴格與廣泛提示進行多輪審計。
Claude Sonnet 5.5 現已在 Google Cloud 上提供,專為編碼及知識工作而設計。它協助用戶更快開發功能及製作整潔的工作材料,並以更快速度降低每項任務成本。
Claude Code v2.1.284 加入 Claude Sonnet 5.5(claude-sonnet-5-5),並將其設為 Anthropic API 的預設 Sonnet 模型。
推薦理由:版本同時涉及模型預設、權限模式、MCP 連線及 Ultracode 操作,並列出終端、VS Code 與 Gateway 的修正,方便用戶核對升級對現有工作流程的影響。
Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。
推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。
OpenAI 正為 Codex Originals 計劃徵集 Codex 使用者的真實故事。徵集對象包括開發者、創客、研究人員及創作者;有意參與計劃下一階段者可分享自己的故事與項目。
Manus 推出 Manus 2.0,帶來 Cascade 最新迭代、Cloud Computer 和 Automations,並將桌面應用升級為 Manus Studio、推出 Cue 獨立應用。
Proaction 藉助 Codex 將銷售額提升 60%,並節省 75+ 小時。Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra,加快現代化車隊管理服務的構建、營運及銷售。
Microsoft 介紹全新 Copilot,加入 Home、Code 和 Autopilot 三項能力,涵蓋工作入口、建立方案及持續運作的智能體。Home 將 Chat 和 Cowork 集於一處,Code 讓用戶以自然語言建立方案,Autopilot 則可在沒有提示詞時持續處理工作。
作者測試 Claude Code 的 effort 等級後指出,較高 effort 會增加模型自主判斷、驗證和邊界案例測試,對需要嚴密驗證的工作尤其有用。Fable 5.1 在 Terminal-Bench 3.0 的安全類通過率由 low effort 組的 64% 升至 top effort 組的 87%,硬件類則由 34% 升至 75%。
Simon Willison愈長時間使用編碼智能體,愈相信它們會令軟件工程更困難。雖然編碼智能體能做到令人驚歎的事,要充分發揮其潛力仍需要非凡的紀律與知識。
Simon Willison 刊出的「commit-rewriter 0.2」頁面未交代該版本的具體內容,只標示為「git 56 Monthly briefing」。他提供每月 $10 的贊助方案,訂閲者可收到當月重要 LLM 動態的精選電郵摘要。
Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。
Cursor 推出 Rollouts 與 Security Reviewer 兩款軟件開發 Bots,前者監控變更由 PR 到生產環境的過程,後者在每個 PR 檢查程式碼庫中的安全問題並提供修復建議。
Simon Willison 與 Jesse Vincent 將於 10 月 14 日在三藩市舉辦智能體工程交流活動,面向使用編程智能體或基於其開發項目的人士。活動以非正式展示交流形式進行,鼓勵分享尚未公開的實驗或未完成項目;毋須準備簡報,亦不作產品推介。
Airbnb 正擴大工程團隊使用 GPT-6 Astra 及 OpenAI 前沿模型的範圍。此舉旨在協助工程團隊修復錯誤、設計系統並加快交付。
Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。
這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。
xAI 發佈 Grok 4.7,現已可在 Cursor、Grok Build、Grok API、第三方編碼 harness、模型路由器及雲平台使用,面向編碼與知識工作。
Pragmatic Engineer主持人Gergely Orosz訪問Matt Pocock,討論他為AI編碼智能體建立可重用技能的做法,以及軟件工程基本原則如何適用於智能體開發。