跳到正文

#Anthropic

今日 49 條
8月27日週四
8月25日週二
8月22日週六
  1. Ahead of AI60

    Claude 如何為 AI 生成文字加入浮水印

    Anthropic 計劃為 Claude 模型生成的文字加入浮水印,Sebastian Raschka 詳解其文字生成與抽樣機制。浮水印在抽樣階段使用秘密金鑰和前四個詞語控制 token 選擇,毋須重新訓練模型;tournament sampling 讓系統可用金鑰和浮水印函數為文字評分,毋須重新執行 LLM。由於浮水印位置不公開,作者指出需改動多處文字才可能移除標記。

8月19日週三
8月15日週六
8月14日週五
  1. Epoch AI:Gradient Updates77

    融資會否成為 AI 算力擴張瓶頸?Anthropic 個案分析

    Epoch AI 以 Anthropic 基建融資為案例,指出近 $50 billion 債務融資顯示,至少短期內融資不太可能成為前沿算力擴張的瓶頸。其中,機構投資者承諾提供 $34.5 billion 債務,支持租賃超過 1 GW 的 Google TPU 系統;另有約 $15.2 billion 貸款支持五個數據中心建設,涉及 1.43 GW 的關鍵 IT 容量。

    推薦理由:Anthropic 個案拆解供應商信用支持租賃融資的結構,呈現未來租金如何轉化為機構資金,以及融資成本如何受風險分擔安排影響。

7月24日週五
7月20日週一
7月10日週五
7月1日週三
  1. Ethan Mollick:One Useful Thing66

    AI 工作模式由聊天機器人協作轉向 Agent 管理

    Ethan Mollick 指出,隨着 AI 系統能持續處理更長任務,工作模式正由人與聊天機器人協作,轉向把工作交給 Agent 執行並由人管理。Epoch 的測試指出,Opus 4.7 獨立工作 14 小時,建成一個相當於人類工程師需花 2-17 週完成的軟件套件,token 成本為 $251。

6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

5月27日週三
  1. Ethan Mollick:One Useful Thing67

    Ethan Mollick:有意識地決定哪些思考工作交給 AI

    Ethan Mollick 主張應有意識地選擇哪些認知工作交由 AI 處理,而非預設讓 AI 代做,避免削弱學習與思考所需的投入。土耳其高中數學實驗中,使用 ChatGPT 的學生作業表現較好,但測驗成績低於未使用 AI 的同學;台北高中五個月 Python 課程中,使用 AI 導師個人化題目序列的學生,在無 AI 協助的期末考高出 0.15 個標準差。

5月19日週二
  1. Claude Platform:開發者版本說明62

    Claude Platform 2026 年 5 月 19 日更新推出 MCP tunnels 研究預覽及 Claude Managed Agents 自託管沙箱

    Claude Platform 5 月 19 日推出 MCP tunnels 研究預覽,並為 Claude Managed Agents 提供自託管沙箱。MCP tunnels 可連接私有網絡中的 MCP 伺服器;進行中的工作階段可更新 MCP 伺服器及工具設定,自託管沙箱則提供 Anthropic 基礎設施以外的工具執行選項。

5月4日週一
4月17日週五
4月6日週一
  1. Manus:Blog51

    2026 年五款最佳桌面 AI 智能體

    文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。

2月24日週二
  1. AI as Normal Technology64

    新論文《Towards a Science of AI Agent Reliability》分析 AI 智能體可靠性

    新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。

2月17日週二
1月29日週四
1月28日週三
11月24日週一
  1. Claude Platform:開發者版本說明79

    Claude Platform 2025 年 11 月 24 日更新推出 Claude Opus 4.5 及多項 API 功能

    Claude Platform 於 2025 年 11 月 24 日推出 Claude Opus 4.5,面向複雜專業任務、專業軟件工程及進階智能體。更新指出,該模型在視覺、編碼和電腦操作方面有顯著改進,定價亦較此前 Opus 模型更易負擔。

    推薦理由:這批更新為多工具工作流程提供兩種改善方式,程式化工具調用旨在降低延遲和 token 用量,工具搜尋則讓大型工具目錄中的工具可按需載入。

8月27日週三
12月19日週四
  1. AI as Normal Technology69

    AI 進展是否正在放緩?

    Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。

10月25日週三
1月24日週二
  1. Hugging Face Blog60

    甚麼令對話智能體有用?

    Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。

    推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。