跳到正文

#編碼

今日 41 條
10月3日週六
  1. TechCrunch · AI67

    Google 發佈 Gemini 4 Argon,稱其為迄今最強模型

    Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。

10月2日週五
  1. Hacker News:AI 熱帖54

    AI 令我難過

    原帖作者感嘆,AI 編碼普及正削弱軟件開發能力帶來的競爭優勢,也令他擔憂工程師的創作樂趣與影響力減弱。回覆者對降低製作門檻的影響看法不一,有人認為 AI 釋放創作能力,也有人憂慮內容氾濫、產品難以差異化、技能貶值和工作流失。

  2. GitHub Blog · AI & ML35

    AI 正改變開發者的工作方式:三項值得加強的技能

    AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。

10月1日週四
  1. Google DeepMind77

    Google DeepMind 發佈 Gemini 4 Argon,面向複雜長流程任務

    Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。

    推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。

  2. Manus:Blog63

    Manus 2.0 推出 Game Dev,讓無編程經驗者以 AI 製作遊戲

    Manus 2.0 推出 Game Dev,讓沒有編程經驗的人可用 AI 製作並打磨自己喜愛的遊戲。它會為遊戲生成專屬調參面板,讓用户遊玩時即時調整速度、重力、傷害和生成頻率,並可管理、替換及用 AI 編輯素材。Game Dev 亦協助處理多人遊戲的伺服器及部署等複雜工作,讓更多玩家可同時加入遊戲。

9月30日週三
  1. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 正式開放使用,面向智能體編碼與專業工作負載

    GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。

    推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。

9月29日週二
  1. Simon Willison84

    OpenAI DevDay 2026 即時紀錄:發佈 GPT-6.1 Sol、Dots 等產品與功能

    OpenAI 在 DevDay 2026 發佈 GPT-6.1 Sol、Dots 智能體及多項開發者工具與功能。GPT-6.1 Sol 主打接近 Astra 的智能水平,價格為 Astra 的五分之一;Ultrafast 最高達 300 tokens/second,速度快 8x,先支援 Astra 6。

    推薦理由:現場紀錄同時追蹤產品宣佈、示範失誤與後續功能場次,讀者可從發佈內容和實際操作兩方面瞭解 OpenAI DevDay 的產品進展。

  2. Pragmatic Engineer68

    Shopify 為何放棄 React Native、轉向原生開發?

    Shopify 決定藉助 AI 智能體,把所有流動應用由 React Native 遷移至 Swift 和 Kotlin,理由是 AI 已降低為 iOS、Android 分別實作功能的成本。Shop app 已在 12 週內以原生方式推出,Shopify app 正在遷移;團隊以共用測試套件驗證兩平台的商業邏輯,功能須通過相同測試才能發佈。

  3. OpenAI News68

    OpenAI 發佈 GPT-6.1 Sol,稱其智能接近 Astra,API 輸入及輸出 token 價格為 Astra 標準價五分之一

    OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。

    推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。

  4. Simon Willison75

    Anthropic 發佈 Claude Sonnet 5.5

    Anthropic 推出 Claude Sonnet 5.5,官方稱其運行速度提升 30% 以上,對大多數工作最多便宜 30%。作者表示其定價與 Sonnet 5 相同,並觀察到它在所有基準測試上似乎都勝過 Sonnet 5,在部分編碼任務上接近 Opus 5.5。

9月28日週一
  1. Anthropic:Claude.dev 開發者博客80

    Claude Sonnet 5.5 開發指南:API 接入、遷移與調校

    Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。

    推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。

9月26日週六
9月25日週五
  1. Anthropic:Claude.dev 開發者博客73

    Claude Code:如何按任務分配 effort 等級

    作者測試 Claude Code 的 effort 等級後指出,較高 effort 會增加模型自主判斷、驗證和邊界案例測試,對需要嚴密驗證的工作尤其有用。Fable 5.1 在 Terminal-Bench 3.0 的安全類通過率由 low effort 組的 64% 升至 top effort 組的 87%,硬件類則由 34% 升至 75%。

  2. Simon Willison7

    Simon Willison 的 commit-rewriter 0.2

    Simon Willison 刊出的「commit-rewriter 0.2」頁面未交代該版本的具體內容,只標示為「git 56 Monthly briefing」。他提供每月 $10 的贊助方案,訂閲者可收到當月重要 LLM 動態的精選電郵摘要。

9月24日週四
  1. Pragmatic Engineer53

    Maggie Appleton 談設計工程與 AI 協作

    Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。

9月23日週三
  1. Modal 官方工程博客63

    Modal 如何為採用萬億參數模型的編碼智能體提供萬億級 token 推理服務

    Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。

9月22日週二
  1. Anthropic:Claude.dev 開發者博客67

    Opus 5.5 在 Claude 和 Claude Code 中的使用指南

    這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。

9月21日週一
9月17日週四