Claude Platform on AWS 多環境存取實作指南
AWS Machine Learning Blog 提供 Claude Platform on AWS 多環境存取指南,示範為 AWS 工作負載、開發者筆電及外部環境配置推理存取。
推薦理由:文章按 AWS 工作負載、開發者筆電與外部環境,示範 cross-account SigV4、workspace-scoped API key 和 OIDC federation 如何配置,並維持 workspace 隔離。
AWS Machine Learning Blog 提供 Claude Platform on AWS 多環境存取指南,示範為 AWS 工作負載、開發者筆電及外部環境配置推理存取。
推薦理由:文章按 AWS 工作負載、開發者筆電與外部環境,示範 cross-account SigV4、workspace-scoped API key 和 OIDC federation 如何配置,並維持 workspace 隔離。
能力研究也會擴展 AI 安全與有用性的帕累托前沿,但擴展選項不代表開發者會選擇更安全的方案。安全研究通常降低提高安全所需付出的有用性代價,能力研究則通常增加以安全換取有用性的誘因。他認為,若開發者已全面自動化 AI 研發,並願意犧牲領先優勢換取安全,某些能力研究或可成為有效的安全乾預;但目前開發者仍處於激烈競爭中。
Tessl提出回饋迴路工程,透過設計智能體周邊的迴路,讓每次執行改善後續工作的項目條件。文章把迴路分為單次改動、跨項目歷史及生產訊號三層,維護智能體分析日誌、PR 評論或程式庫狀態後,會把需修正事項整理成一般問題單交回既有開發流程,而不自行開 PR。
AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。
智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。
Leapfrog 團隊的作者分享以 OpenClaw、GitHub、Obsidian 和 Telegram 搭建組織記憶系統,讓團隊可透過智能體以自然語言查詢公司知識與客户脈絡。研究庫當時約有 1,200 個檔案,另設客户資料庫;系統區分個人、領導層、公司與客户知識,只把經判斷扎實且有用的研究升格分享。作者建議先讓一人本機試行,確認維護、權限及資料安全要求,再按實際需要逐步增加檢索層。
Tessl 已完成 SOC 2 Type II 審核,審核由獨立審計機構 A-Lign 執行,涵蓋其日常資料保護控制。報告涉及客户資料存取限制、持續監察與事件應變、員工安全培訓,以及安全軟件開發。客户可到 Tessl Trust Center 查看安全文件並申請完整 SOC 2 Type II 報告;Tessl 正推進 ISO 27001 認證,內部審計於本月開始,外部審計安排在 11 月。
Dario Amodei 的 Google Scholar 頁面列出其 AI 研究論文、合著者、出版資訊及引用數,涵蓋語言模型、AI 安全與人類偏好強化學習。《Language models are few-shot learners》列有 83,699 次引用,《Language models are unsupervised multitask learners》列有 25,007 次引用。
AI 文件分類利用訓練模型理解文件內容、結構與語境,自動分配類別及標籤,並將文件送入相應工作流程。傳統機器學習分類器須以數千份已標註文件訓練;大語言模型可根據自然語言類別描述進行零樣本分類,無須標註訓練資料。信心評分讓高信心結果直接流轉,低信心結果轉交人工審核。
KYC 自動化以軟件執行文件擷取、身份核驗、制裁篩查和風險評分,將人工審核集中於例外個案。標準案件的處理時間可由數天至數星期降至數分鐘至數小時,並留下完整、帶時間戳且可核查的審計紀錄。LlamaParse 以智能體式文件解析、版面感知電腦視覺及多重驗證迴圈,將不同格式文件轉為結構化資料。
按揭文件自動化把貸款申請、核保、驗證及成交中的人工文件工作,轉化為結構化、由機器處理的流程。系統結合機器學習、電腦視覺與結構化解析,辨識文件版面並抽取符合預設 schema 的資料,不止進行文字識別。抽取結果會按業務規則、核保準則及外部數據來源驗證,並以信心評分和人工審核處理模糊或不確定個案。
標準 OCR 難以滿足 KYC 合規要求,因其無法可靠辨識磨損、斜拍、帶有防偽特徵或使用非拉丁文字的真實身份文件。人工資料輸入錯誤率平均為 1–4%,而真正直通式處理要求欄位準確率達 99.9%。錯誤欄位會流入 AML 篩查及合規紀錄,觸發誤報、錯過名單匹配或延誤客户開户。
Meta AI 公佈 Brain2Qwerty v2 研究,展示以非侵入式腦訊號即時解碼句子的端到端流程,詞準確率達 61%,高於文中所述其他非侵入式方法的 8%。
Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。
推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
Google 示範為客服退貨智能體配置零信任運行時治理,檢查提示、工具調用及跨輪次行為。方案部署於 Gemini Enterprise Agent Platform。
Google 在 Gemini Enterprise Agent Platform 為 Agent Anomaly Detection 開放 Private Preview,提供自主智能體的推理式監督與審計層。
Google 將高級 Google Colab 權益納入 Google AI 訂閲,訂户可優先使用更快的加速器和效能更強的機器。Google AI Ultra 訂户另可使用不中斷的背景執行和 Premium GPU,讓長時間訓練無須保持瀏覽器分頁開啟。現有 Colab 訂閲不變,Google AI 訂閲權益可疊加;相關權益將於未來數週向 Colab 支援國家的 Google AI 訂户推出。
Google 宣佈 Antigravity SDK 支援多種本地模型與執行方式,初步支援透過 Google AI Edge 的 LiteRT 運行 Gemma 4 26B A4B,讓智能體協助可完全離線執行。
Google Cloud API Gateway 在 Public Preview 中可充當遠端 MCP server,將現有 REST 操作轉為智能體可調用的 MCP 工具。
Google 團隊在 TPU v6e 上優化 SVG 稀疏注意力的執行流程,令 720p、81 幀影片的端到端去噪提速 1.28×。去噪時間由 153.50 s 降至 119.86 s;在 1440p(302K tokens)下則由 2,471 s 降至 1,461 s,提速 1.69×,PSNR 為 24.05 dB。
Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。
推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。
Anthropic Economics 團隊的 Econ Scenario Explorer v1.0 讓使用者設定對 AI 能力、採用程度等因素的預期,推演 2030 年美國經濟情境。
優秀的人類提問者仍比 AI 更能挖掘人們尚未説出口的經驗與好故事。這些「隱性知識」難以文件化,往往要透過提問與觀察才能浮現;組織若無法挖掘,品牌訊息便容易與千篇一律的內容無異。
Laura Entis 訪問五位專業寫作者,整理他們如何使用 AI、哪些地方令他們失望,以及哪些工作仍堅持親自完成。文章指出沒有通用流程,同一工具可能幫助一位作者理清思路,也可能令另一位的文筆變差。
作者把親自使用 AI 智能體所構建的軟件、判斷體驗並反覆修整,視為 compound engineering 的最後一步。他以 `/ce-polish` 檢出分支、啟動開發伺服器,並在編輯器中與智能體並排查看應用程式。在 Cora Brief 中,他透過 Monologue 指出版面留白過多、卡片需要更緊湊,智能體調整版面後,應用程式隨即熱重載。
研究以涵蓋五個資料集、三類任務的 1,891 個樣本,評估 11 個 LLM 在實際 RAG 設定中的檢索穩健性;整體穩健性普遍偏高,但因任務而異。停用推理時,Qwen 和 GPT 模型的穩健性明顯下降,即使在單跳 QA 任務上亦然;把檢索文件作為工具回覆提供,則提升 Claude 模型表現、損害 Qwen 和 GPT 模型表現。研究指出,是否採用 RAG 仍須按個案判斷。
OpenAI 的 Apps SDK 頁面列出開發者文件與資源,涵蓋 API、Agents、工具、音訊與語音、部署及 API 參考。頁面亦列出以使用者 ChatGPT 方案運作的 Apps、可擴展 ChatGPT 和 Codex 的 Plugins、Workspace Agents,以及在 ChatGPT 建立 Commerce 流程和發布、衡量 Ads 的相關資源。
OpenAI API 開發者頁面匯集模型探索、智能體建置、工具與資料連接、音訊及語音體驗、部署和 API 參考等資源。頁面亦提供 ChatGPT 與 Codex 文件、使用案例、Cookbook、示例應用、開發者學習資料及社羣支援入口。
OpenAI Developers 彙整 OpenAI API、模型、智能體、工具及音訊與語音開發資源,並涵蓋部署、API 參考,以及 ChatGPT 和 Codex 文件。頁面亦列出用例、Cookbook 範例、示範應用、開發者網誌及社羣支援。
OpenAI 推出 Rosalind Workbench,為生命科學研究者提供整合科學工具、資料分析工作流程與研究證據的虛擬工作台。產品以 research preview 形式透過 ChatGPT app 提供,包含 Explore 與 Research 兩種模式;已驗證的組織成員可代機構申請,個人使用權限即將推出。
OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。
MiniMax 將升級版 MiniMax Agent 更名為 Mavis,並推出 Agent Teams,讓桌面版可並行運行多個不同角色的 Agent,協作處理複雜任務。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。
MiniMax 發佈 Music 3.0 音樂生成模型,可依據創意概念及可選歌詞,在一次生成中完成最長 5 分鐘的歌曲。模型採用 8 層 RVQ、由 Qwen3.5-8B 初始化的 8B Global LLM、0.6B Local LLM,並透過 2.4B flow-matching 模組及 123M Flow-VAE 重建音訊。
Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。
AE Studio 與 Anthropic 合作的研究團隊提出 Gradient-Routed Auxiliary Modules(GRAM),以可切換的輔助模組隔離語言模型中的特定雙重用途能力。
Anthropic 與 Redwood Research 建立 Conceptual Reasoning Index(CRI),整合 LMCA、ACCoRD 和 DTBench capabilities 三項基準評估模型的概念推理能力。
Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。