Claude Code Opus 5 Auto Mode 小樣本測試觸發程式碼執行,提示詞注入成功率最高達 80%
Johann Rehberger 測試 Claude Code Opus 5 Auto Mode,利用網站摘要請求觸發提示詞注入鏈,在小樣本測試中達到 60-80% 攻擊成功率並執行程式碼。
Johann Rehberger 測試 Claude Code Opus 5 Auto Mode,利用網站摘要請求觸發提示詞注入鏈,在小樣本測試中達到 60-80% 攻擊成功率並執行程式碼。
Dylan Patel 在與 Dwarkesh Patel 的訪談中預測,若目前趨勢延續,Anthropic 與 OpenAI 到 2028 年底將掌握全球大部分可用算力。
Anthropic 計劃為 Claude 模型生成的文字加入浮水印,Sebastian Raschka 詳解其文字生成與抽樣機制。浮水印在抽樣階段使用秘密金鑰和前四個詞語控制 token 選擇,毋須重新訓練模型;tournament sampling 讓系統可用金鑰和浮水印函數為文字評分,毋須重新執行 LLM。由於浮水印位置不公開,作者指出需改動多處文字才可能移除標記。
作者訪談近 20 位正休職或認真考慮休假的工程領導者,整理高階主管離職或暫停職涯的常見原因。原因包括工作條件惡化、初創企業前景和股權轉差、難以累積 AI 經驗,以及團隊縮小令管理職需求下降。作者私下詢問的工程領導者中,6/10 表示正準備離開職位。
Greg Burnham 在 Epoch AI 的 Gradient Updates 中提出九個關於 AI 能力與影響的問題,探討基準評測如何協助回答。問題涵蓋 AI 能否承擔開放式工作、推理擴展是否持續帶來收益、AI 能否參與 AI 研發,以及強化學習能否跨領域泛化。
Epoch AI 以 Anthropic 基建融資為案例,指出近 $50 billion 債務融資顯示,至少短期內融資不太可能成為前沿算力擴張的瓶頸。其中,機構投資者承諾提供 $34.5 billion 債務,支持租賃超過 1 GW 的 Google TPU 系統;另有約 $15.2 billion 貸款支持五個數據中心建設,涉及 1.43 GW 的關鍵 IT 容量。
推薦理由:Anthropic 個案拆解供應商信用支持租賃融資的結構,呈現未來租金如何轉化為機構資金,以及融資成本如何受風險分擔安排影響。
Thariq Shihipar 分享 Claude 5 世代模型的上下文工程新規則,主張減少限制並按需載入指引。Anthropic 團隊為 Claude Opus 5 和 Claude Fable 5 將 Claude Code 的系統提示詞削減逾 80%,編碼評測未見可測量的表現下降。
Ethan Mollick 建議按任務風險和工作類型選用 AI,並以 ChatGPT 或 Claude 的智能體處理實際工作。低風險問答可用合適的免費模型;高風險議題則建議選 Claude 的 Opus 或 Fable,或將 ChatGPT 的 GPT-5.6 Sol 設為至少「High」思考級別。
Import AI 465 整理英國 AI Security Institute 的分析,指出開放權重模型在網絡安全能力上與閉源前沿模型的差距,由 2025 年多數時間的 6–10 個月縮至 4–7 個月。
Arvind Narayanan 與 Akash Kapur 認為,模型推理競爭可能把價格壓向 token 生產的邊際成本,AI 實驗室更可能透過向堆疊上層遷移來實現持續盈利。
Ethan Mollick 指出,隨着 AI 系統能持續處理更長任務,工作模式正由人與聊天機器人協作,轉向把工作交給 Agent 執行並由人管理。Epoch 的測試指出,Opus 4.7 獨立工作 14 小時,建成一個相當於人類工程師需花 2-17 週完成的軟件套件,token 成本為 $251。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
Ethan Mollick 主張應有意識地選擇哪些認知工作交由 AI 處理,而非預設讓 AI 代做,避免削弱學習與思考所需的投入。土耳其高中數學實驗中,使用 ChatGPT 的學生作業表現較好,但測驗成績低於未使用 AI 的同學;台北高中五個月 Python 課程中,使用 AI 導師個人化題目序列的學生,在無 AI 協助的期末考高出 0.15 個標準差。
Claude Platform 5 月 19 日推出 MCP tunnels 研究預覽,並為 Claude Managed Agents 提供自託管沙箱。MCP tunnels 可連接私有網絡中的 MCP 伺服器;進行中的工作階段可更新 MCP 伺服器及工具設定,自託管沙箱則提供 Anthropic 基礎設施以外的工具執行選項。
Jack Clark 根據公開研究與產品進展,估計到 2028 年底前,AI 系統自主訓練後繼模型、實現無人參與 AI 研發的機率約為 60%。他以 SWE-Bench 成績由 Claude 2 的約 2% 升至 Claude Mythos Preview 的 93.9%,以及 AI 在研究復現、模型微調和長時間任務上的進展,作為主要依據。
Claude Platform 推出 Workload Identity Federation,讓工作負載使用自有身份提供者簽發的短期 OIDC token 向 Claude API 驗證身份,取代長期靜態 API key。用戶可在 Claude Console 設定發行者與聯邦規則,SDK 會自動處理 token 交換與更新。
Sayash Kapoor 等研究者提出開放世界評測框架,並介紹由 17 位研究者參與的 CRUX 協作項目,計劃定期評估前沿 AI 能力。首項實驗使用 OpenClaw 與 Claude Opus 4.6,AI 智能體經兩次錯誤(其中一次需人手介入)後,成功將簡單 iOS App 上架 App Store,總成本約 $1,000。
文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。
新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。
Anthropic 在 Claude Platform 推出 Claude Sonnet 4.6,定位為兼顧速度與智能的日常任務模型,智能體搜尋表現提升且 token 消耗較少。
Claude API 已將 Claude Sonnet 4.5、Claude Opus 4.5 和 Claude Haiku 4.5 的結構化輸出功能移出 Beta。
Hugging Face 介紹 upskill 如何以 Claude Opus 4.5 完成 CUDA kernel 任務、從任務軌跡生成 Agent 技能,再評估技能對其他模型的效果。文中一個示例中,unsloth/GLM-4.7-Flash-GGUF:Q4_0 的測試表現由 40% 升至 85%;部分模型使用技能後 token 用量反而增加,文章建議逐一比較。
Claude Platform 於 2025 年 11 月 24 日推出 Claude Opus 4.5,面向複雜專業任務、專業軟件工程及進階智能體。更新指出,該模型在視覺、編碼和電腦操作方面有顯著改進,定價亦較此前 Opus 模型更易負擔。
推薦理由:這批更新為多工具工作流程提供兩種改善方式,程式化工具調用旨在降低延遲和 token 用量,工具搜尋則讓大型工具目錄中的工具可按需載入。
OpenAI 與 Anthropic 分享首個同類聯合安全評估的結果,雙方互相測試對方的模型。評估涵蓋對齊失準、指令遵循、模型幻覺與越獄等,並呈現相關進展、挑戰及跨實驗室合作的價值。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。
OpenAI 聯同 Anthropic、Google 及 Microsoft 宣佈 Frontier Model Forum 的新任執行董事,並公佈一項新的 $10 million AI Safety Fund。
Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。
推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。