跳到正文

#編碼

今日 12 條
今天10月6日週二
  1. Claude:Blog74

    編碼工作階段更長、使用更多上下文,Claude Opus 5.5 為此而設

    Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。

10月5日週一
  1. MarkTechPost78

    GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1:不同工作適合哪款前沿模型?

    MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。

    推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。

10月3日週六
  1. MiniMax:Blog76

    MiniMax M2.5:為真實工作場景生產力而打造

    MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。

    推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。

  2. Meta AI:Research Blog76

    Meta 發佈 Muse Spark 1.1,並開放 Meta Model API 公開預覽

    Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。

    推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。

  3. Artificial Analysis 完整文章77

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,Intelligence Index 接近 GPT-6 Astra

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。

    推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。

  4. TechCrunch · AI67

    Google 發佈 Gemini 4 Argon,稱其為迄今最強模型

    Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。

10月1日週四
  1. Google DeepMind77

    Google DeepMind 發佈 Gemini 4 Argon,面向複雜長流程任務

    Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。

    推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。

9月29日週二
  1. OpenAI News68

    OpenAI 發佈 GPT-6.1 Sol,稱其智能接近 Astra,API 輸入及輸出 token 價格為 Astra 標準價五分之一

    OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。

    推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。

  2. Simon Willison75

    Anthropic 發佈 Claude Sonnet 5.5

    Anthropic 推出 Claude Sonnet 5.5,官方稱其運行速度提升 30% 以上,對大多數工作最多便宜 30%。作者表示其定價與 Sonnet 5 相同,並觀察到它在所有基準測試上似乎都勝過 Sonnet 5,在部分編碼任務上接近 Opus 5.5。

9月28日週一
  1. Anthropic:Claude.dev 開發者博客80

    Claude Sonnet 5.5 開發指南:API 接入、遷移與調校

    Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。

    推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。

9月21日週一
9月16日週三
9月3日週四
  1. OpenAI:部署安全與系統卡73

    GPT-6 Astra 系統卡公佈安全與能力評估結果

    OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。

8月25日週二
8月14日週五
8月12日週三
7月21日週二