跳到正文

#Anthropic

今日 50 條
10月3日週六
10月2日週五
  1. TechCrunch · AI54

    教宗良十四世呼籲保護人類藝術,稱 AI 生成作品與人類藝術存在本體差異

    教宗良十四世在 X 發文,呼籲在 AI 時代保護人類藝術,並稱人類創作與機器生成作品在本體上存在差異。他認為機器根據數百萬張他人創作的圖像進行統計計算,算法缺乏人性的火花。他 5 月的通諭強調自動化日益普及時維護人類尊嚴的重要性;TechCrunch 援引《紐約時報》近期報道稱,Anthropic 曾遊説梵蒂岡重新考慮非人類意識立場,但似乎成效有限。

10月1日週四
  1. The Decoder51

    Anthropic 向美國民用機構提供 Claude for Government,與五角大樓的爭端仍在持續

    Anthropic 現向美國聯邦及州級民用機構提供 Claude for Government,平台自 7 月起開放測試,並運行於 FedRAMP High 環境,這是美國最嚴格的雲端安全級別。機構按用量付費並設有固定上限,管理員可按部門設定預算與模型存取權限;敏感操作須雙人批准,對話保留在機構裝置上。五角大樓禁止 Claude,爭端源於 Anthropic 拒絕撤除對大規模監控及自主武器的禁令。

  2. Ethan Mollick:One Useful Thing70

    Ethan Mollick 重新評估 AI 智能體自我組織的管理難度

    Ethan Mollick 重新評估智能體管理的難度,認為 AI 模型已能自行規劃及組織協作,安排智能體工作未必需要繁複的人為設計。他以 OpenAI 的 swarm 為例,稱數千個智能體處理 Navier-Stokes 存在性與光滑性問題,歷時 88 小時並互傳約 2.7 million 則訊息;相關成果尚未獲正式接納。他也指出,智能體仍有能力限制和失控風險,人類需要設定目標並在過程中調整方向。

9月30日週三
  1. elsewhere:文章55

    數據公司個個都太神了

    數據公司估值快速攀升,成立未滿一年的公司中已有 UniPat 估值達25億美元,另有若干家公司估值3-8億美元。數據商透過採集專家解題軌跡,或製作包含任務、運行環境和評分準則的 RL environment,為模型提供訓練材料;文章指出模型公司現時更重視數據交付的速度、數量和供應商關係。這個行業尚無公認驗收標準,模型公司通常先抽檢,再從小額訂單逐步建立合作信任。

9月29日週二
  1. Azeem Azhar:Exponential View74

    Anthropic 的 IPO 招股文件顯示收入增長快於成本

    Azeem Azhar 分析 Anthropic 的 S-1 招股文件,指公司收入增長快於成本,並可能於 2026 年轉為盈利。文件列出 2025 年 $8bn 營運虧損及 $42bn 淨虧損,後者受一筆會計費用推高。公司有為期 7-10 年、總額 $518bn 的算力承諾,約 80%(約 $410bn)不可取消;其年化收入預計於 2026 年底超過 $100bn。

  2. Simon Willison75

    Anthropic 發佈 Claude Sonnet 5.5

    Anthropic 推出 Claude Sonnet 5.5,官方稱其運行速度提升 30% 以上,對大多數工作最多便宜 30%。作者表示其定價與 Sonnet 5 相同,並觀察到它在所有基準測試上似乎都勝過 Sonnet 5,在部分編碼任務上接近 Opus 5.5。

  3. MIT Technology Review · AI60

    AI 何時才算作出科學發現?Anthropic 生物學案例引發判準爭議

    Anthropic 將 Claude 智能體找到的生物學模式稱作一項發現,但生物學家質疑僅識別模式是否足以構成科學發現。Anthropic 稱 950 個智能體經 21 小時在已知酶周邊找出此前未編目的重複模式;Mario Rodríguez Mestre 則表示其團隊早已發現該模式,Anthropic 否認從他與 Claude 的對話中得知。

9月28日週一
  1. Anthropic:Claude.dev 開發者博客80

    Claude Sonnet 5.5 開發指南:API 接入、遷移與調校

    Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。

    推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。

9月26日週六
  1. Claude Code:GitHub Releases50

    Claude Code v2.1.283 更新加入模型管控、提示詞審核及閘道負載測試

    Claude Code 發佈 v2.1.283,新增模型可用性管控、提示詞審核及閘道負載測試模式,並修正多項 MCP、插件與工作流問題。管理設定可限制可用模型版本或封鎖指定模型;/doctor prompt-audit 可檢查 CLAUDE.md、skills、agents 和 commands 中為舊模型編寫的提示詞模式。負載測試模式會建立並簽署請求,但不會發送至上游,客戶端則會收到固定回覆。

9月25日週五
  1. Anthropic:Claude.dev 開發者博客73

    Claude Code:如何按任務分配 effort 等級

    作者測試 Claude Code 的 effort 等級後指出,較高 effort 會增加模型自主判斷、驗證和邊界案例測試,對需要嚴密驗證的工作尤其有用。Fable 5.1 在 Terminal-Bench 3.0 的安全類通過率由 low effort 組的 64% 升至 top effort 組的 87%,硬件類則由 34% 升至 75%。

9月23日週三
  1. Latent Space83

    Anthropic 發佈 Claude Opus 5.5 並成為 AINews 預設模型,OpenAI 推出降價版 GPT-6 Sol 與 GPT-6 Luna

    Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。

    推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。

9月22日週二
  1. Anthropic:Claude.dev 開發者博客67

    Opus 5.5 在 Claude 和 Claude Code 中的使用指南

    這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。

  2. MIT Technology Review · AI53

    別被今夏的 AI 炒作矇蔽

    Timnit Gebru 與 Emily M. Bender 指出,今夏企業圍繞 AI 模型漏洞、數學突破和超級智能的宣傳,常被媒體以人格化敍事放大,而專家後續檢視提出了不同解讀。她們認為,把事件描述成「失控模型」或迫近的超級智能,會把注意力從企業責任轉向假想中的機器風險,也淡化數據中心造成的氣候、健康、電費與用水影響。她們呼籲決策者和公眾放慢決策步伐,聽取獨立專家的意見,不要只依賴企業宣傳。

9月18日週五
  1. Timothy B. Lee:Understanding AI62

    Jacob Coxon 的一則推文如何改變 AI 安全辯論

    Anthropic 員工 Jacob Coxon 宣佈離職並批評 AI 公司未負責任行事,其推文瀏覽量超過 170 million 次,令 AI 風險突然成為主流議題。文章指出,AI 風險已成為美國全國層面的政治議題,但全球暫停前沿 AI 系統的協議短期內似乎難以達成,國會亦不太可能在新年前通過 AI 法案。一些公司領導人則表示,若競爭對手也放慢步伐,他們願意自願減速。

9月16日週三
9月14日週一
9月9日週三
  1. Pragmatic Engineer63

    AI 智能體生成程式碼激增後,程式碼審查有哪些新做法?

    面對 AI 智能體生成更多程式碼和 PR 所帶來的審查量增長,各團隊採用不同流程,沒有適用所有團隊的單一方案。GitHub 數據顯示,三年間開啟的 PR 數量增至五倍,2025 年底增長加速,PR 和 commits 數量在當時幾乎翻倍。常見做法包括由人審核 AI 的程式碼審查結果、按變更風險決定是否人工審查,以及改為審查計劃、測試或資料庫 schema。