為何 AI 競賽轉向推理速度
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
Replit 表示,已將 Agent 系統融入公司多個部門的工作流程,逐步形成由人設定目標、Agent 執行任務並檢查結果的「自我運作公司」模式。從 1 月初至 6 月底,程式碼貢獻量增加 5.8 倍;固定作者羣的程式碼產出達之前的 2.9 倍,而審查延遲、PR 回退率及事故數維持平穩。
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
Epoch AI 分析指出,OpenAI 研究員的編碼智能體用量在 2026 年 1 月至 8 月中旬快速增長,指數擬合顯示兩組用量約每月翻倍。
Pop!_OS 禁止在其大部分程式碼庫中使用 AI 生成的程式碼。評論推測,Pop!_OS 和 Cosmic 市場佔有率偏低,較少成為攻擊者及不良行為者的目標,因此項目可以只接納人手編寫的程式碼。
Hacker News 的提問者詢問,有沒有人能用編碼智能體產出優質程式碼,並表示這是他從資深工程師處聽到的真實難題。他稱 AI 生成的程式碼常繁複且充滿陷阱,審查 Claude merge requests 要多花 5x 時間,自己仍難以理解批准的改動。他質疑解法是否只能達到「level 4 autonomy」,不再閲讀或編寫程式碼,並求助已解決此問題的人。
作者認為,Vibe Coding 並不足以支撐嚴肅系統開發,AI 編碼仍需精確規格、獨立驗證與增量學習。文章提到,一位使用多個 AI 智能體的人估計每日產出 12,000 行程式碼,作者指出瓶頸在規格、驗證與發布。他主張把規格納入版本控制,在部署流程自行執行測試,並透過小步變更持續收集回饋。
Tessl 研究員兼工程師提出 Harness Engineer 角色,主張 AI 智能體愈多負責編碼,工程重心愈轉向設計和管理其運行系統。他將相關工作歸納為明確系統不變條件、分析智能體及程式碼數據、按風險安排審核;Tessl 以約 1,000 個開源技能測試智能體,發現平均只有約 70% 的技能指令獲遵循。
Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。
智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。
Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。
推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。
原帖作者感嘆,AI 編碼普及正削弱軟件開發能力帶來的競爭優勢,也令他擔憂工程師的創作樂趣與影響力減弱。回覆者對降低製作門檻的影響看法不一,有人認為 AI 釋放創作能力,也有人憂慮內容氾濫、產品難以差異化、技能貶值和工作流失。
MIT 的 Alex Zhang 在訪談中主張,學術研究者應押注產業實驗室較少關注、初看可能微不足道或古怪的研究方向。他將 Recursive Language Models(RLMs)描述為以程式碼作為唯一工具、讓模型可以遞迴調用自身,並在程式環境中保存上下文的 harness。
GitHub Blog 作者挑選了 GitHub Universe 2026 的 10 場技術演講,涵蓋 AI 智能體記憶、評測、權限及生成程式碼驗證。其他主題包括 npm 依賴項與供應鏈安全、JavaScript 工具鏈,以及在網絡連線不穩定環境下開發軟件。
Gergely Orosz 訪問 Cockroach Labs 聯合創辦人兼 CTO Peter Mattis,討論分佈式數據庫、存儲系統設計及 AI 對軟件工程工作的影響。
Anthropic 為 Claude Code 的 claude-api plugin 加入 build_eval 和 hill-climb 指令,協助建立評測、檢查評分器並改進應用程式。
Shopify 決定藉助 AI 智能體,把所有流動應用由 React Native 遷移至 Swift 和 Kotlin,理由是 AI 已降低為 iOS、Android 分別實作功能的成本。Shop app 已在 12 週內以原生方式推出,Shopify app 正在遷移;團隊以共用測試套件驗證兩平台的商業邏輯,功能須通過相同測試才能發佈。
Simon Willison愈長時間使用編碼智能體,愈相信它們會令軟件工程更困難。雖然編碼智能體能做到令人驚歎的事,要充分發揮其潛力仍需要非凡的紀律與知識。
Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。
Simon Willison 與 Jesse Vincent 將於 10 月 14 日在三藩市舉辦智能體工程交流活動,面向使用編程智能體或基於其開發項目的人士。活動以非正式展示交流形式進行,鼓勵分享尚未公開的實驗或未完成項目;毋須準備簡報,亦不作產品推介。
Pragmatic Engineer主持人Gergely Orosz訪問Matt Pocock,討論他為AI編碼智能體建立可重用技能的做法,以及軟件工程基本原則如何適用於智能體開發。
Pragmatic Engineer 訪問 Codex 開發者、OpenAI Core Products & Platform 部門主管 Tibo Sottiaux,探討 Codex 的構建決策、演進及團隊使用方式。
面對 AI 智能體生成更多程式碼和 PR 所帶來的審查量增長,各團隊採用不同流程,沒有適用所有團隊的單一方案。GitHub 數據顯示,三年間開啟的 PR 數量增至五倍,2025 年底增長加速,PR 和 commits 數量在當時幾乎翻倍。常見做法包括由人審核 AI 的程式碼審查結果、按變更風險決定是否人工審查,以及改為審查計劃、測試或資料庫 schema。
OpenAI 內部的編碼智能體正重塑 AI 研究。早期數據涵蓋智能體使用情況、實驗速度、任務複雜度及研究加速。
Gergely Orosz 訪問 Addy Osmani,回顧他從 Chrome DevTools、Core Web Vitals 到 AI 開發者體驗的工作歷程。
作者訪談近 20 位正休職或認真考慮休假的工程領導者,整理高階主管離職或暫停職涯的常見原因。原因包括工作條件惡化、初創企業前景和股權轉差、難以累積 AI 經驗,以及團隊縮小令管理職需求下降。作者私下詢問的工程領導者中,6/10 表示正準備離開職位。
Arvind Narayanan 在 ICML 主題演講中主張,AI 會逐步改變並重組工作,但不會因實驗室內某個能力里程碑而突然令所有人失業。他以 AI as Normal Technology 框架概括能力、產品、早期採用和適應四個階段,認為工作結構的適應最慢,需時數十年。他預期 AI 會令工作重心由建造系統轉向評估、判斷與引導,並主張培養與 AI 互補的技能及維持使用上的自主掌控。
文章認為,AI 尚未取代軟件工程師,單靠能力提升也不會消除這類工作的需求。作者以「決策、執行、交付」三層框架解釋,AI 壓縮程式碼實作的執行層,但需求界定、驗證及交付責任仍需人員承擔。一項涵蓋 GitHub 上 100,000 名開發者的研究顯示,AI 智能體令程式碼行數增加 8 倍,發布量只增加 30%。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
Parameter Golf 匯集 1,000+ 名參與者及 2,000+ 份投稿,探索在嚴格限制下進行 AI 輔助機器學習研究。探索範圍包括編碼智能體、量化及新型模型設計。
Jack Clark 根據公開研究與產品進展,估計到 2028 年底前,AI 系統自主訓練後繼模型、實現無人參與 AI 研發的機率約為 60%。他以 SWE-Bench 成績由 Claude 2 的約 2% 升至 Claude Mythos Preview 的 93.9%,以及 AI 在研究復現、模型微調和長時間任務上的進展,作為主要依據。
Manus Blog 以同一份個人理財網站提示詞實測 Replit、Manus AI、Lovable、Vercel v0、Base44 和 Hostinger Horizons,並比較各工具的生成結果與使用體驗。
Manus 以同一組 PR 案例評測 9 款 AI 代碼審查工具,涵蓋錯誤修復、重構、依賴更新和權限邊界。結果顯示,各工具在安全關鍵邏輯的風險檢測深度上差異明顯,工作流原生整合不代表分析更深入。Manus 在明確框定為安全審查的授權反轉測試中,生成了著重失敗模式、影響和補救步驟的報告,但未原生嵌入 PR 討論串作為自動審查員。
一名非技術背景的內容寫作者以同一提示測試 Lovable、Replit、Bolt、Cursor 及 Manus,要求五款氛圍編碼工具製作個人作品集網站。測試中,Lovable 對初學者最友善,Manus 付費版最貼近其流行藝術設計要求;Manus 免費版出現 404 錯誤,而作者未能用 Cursor 產出網站。文章指出,工具各有適用人羣,提示須清晰具體,付費方案也可能帶來更符合創意要求的結果。
Hamel Husain 因 AI 編碼工具改變開發工具的取捨,停止使用自己曾協助建立及維護的 nbdev。nbdev 以 Jupyter notebooks 作為程式碼、文件和測試的單一來源,再轉譯成 Python 程式庫和文件網站;他認為這種工作流令 AI 工具難以分辨應修改 notebook 還是最終程式碼。
Lovable、Replit 與 Manus 分別以提示詞生成程式碼、AI 輔助 IDE 和自主 AI Agent 建站,文中評定 Manus 為 2026 年最全面的 AI 網站建構工具。