Amazon 發佈受 Jev 啟發的開源決策模型 Strands Decider 2B
Amazon Web Services 發佈開源決策模型 Strands Decider 2B,基於 Qwen3.5-2B,可從預設選項中快速、低成本地作出選擇並提供信心分數。模型現已全面開源,體積足以在本地運行。Amazon 工程師 Marc Brooker 表示,智能體工作流並非每一步都需要完整大語言模型的能力或成本。
Amazon Web Services 發佈開源決策模型 Strands Decider 2B,基於 Qwen3.5-2B,可從預設選項中快速、低成本地作出選擇並提供信心分數。模型現已全面開源,體積足以在本地運行。Amazon 工程師 Marc Brooker 表示,智能體工作流並非每一步都需要完整大語言模型的能力或成本。
404 Media 本週播客回顧 FBI 遭黑客入侵事件,並提及涉及所有 FBI 員工及其配偶的資料外洩。節目亦談到一家監控公司向警方表示,希望把人臉辨識技術用於 Flock 攝影機資料。付費訂閲者專屬環節則討論 Meta 的新型 AI 智能體 Muse,並提及部分任務實際由人類完成。
Anthropic 已推遲原定 10 月的 IPO,目前計劃在感恩節前的 11 月開始交易,上市時點遇上市場不確定性增加。公司去年錄得約 $8 billion 營業虧損及 $4.6 billion 收入,並承諾未來數年投入 $518 billion 於雲端、運算及基建。
OpenAI 的 GPT-6 系列模型指南説明初創企業如何選擇 GPT-6 模型、調整推理力度,並準備投入生產的工作流程。指南亦涵蓋改善提示詞與技能,以及協調工具。
AWS 介紹並部署 Adjudicated Query 模式,讓 Amazon Quick 的自然語言合規查詢透過固定 MCP 操作交由確定性規則引擎判定,而非由模型作出決策。
推薦理由:文章把自然語言查詢與合規判定分開,並以完整性收據和逐筆證據鏈展示如何核對大量檢查結果。
AWS 説明如何透過 Amazon Bedrock AgentCore Gateway,將受 JWT 驗證的 Web Search 接入 Claude Desktop on Amazon Bedrock。
教宗良十四世在 X 發文,呼籲在 AI 時代保護人類藝術,並稱人類創作與機器生成作品在本體上存在差異。他認為機器根據數百萬張他人創作的圖像進行統計計算,算法缺乏人性的火花。他 5 月的通諭強調自動化日益普及時維護人類尊嚴的重要性;TechCrunch 援引《紐約時報》近期報道稱,Anthropic 曾遊説梵蒂岡重新考慮非人類意識立場,但似乎成效有限。
Oracle 威斯康辛州 AI 資料中心的電力審批預計將令項目延誤。評論者指出,Oracle 債券評級為 BBB-,僅高於垃圾級一級,並推測公司可能因融資困難和前期建設開支而退出資料中心合約。他預測 Oracle 或於兩三年後收購現代技術企業,以重奪市場。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
Mozilla 將關閉 Solo AI 網站製作工具。留言者對 Mozilla 的 AI 功能與側項目評價不一:有人認為它們未改善網頁體驗,也有人肯定裝置端語言翻譯和分頁羣組名稱建議,但對頁面摘要依賴外部伺服器處理文字有所保留。
原帖作者感嘆,AI 編碼普及正削弱軟件開發能力帶來的競爭優勢,也令他擔憂工程師的創作樂趣與影響力減弱。回覆者對降低製作門檻的影響看法不一,有人認為 AI 釋放創作能力,也有人憂慮內容氾濫、產品難以差異化、技能貶值和工作流失。
AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。
Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。
推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。
Nvidia Shield TV Pro 現售 $299.99,較此前貴 $100,漲價原因是 AI。這款產品最初於 2019 年推出。
Airbnb CTO Ahmad Al-Dahle 説明公司正以「由內而外」方式推進 AI 轉型,先用 AI 加快產品開發,再把相關能力用於住客體驗。Airbnb 稱 60% 的程式碼由 AI 撰寫,功能與改進交付量按年增加近 80%,平均工程師的 pull request 吞吐量約為 1.6x;AI 亦直接解決約一半客户支援個案。
NVIDIA 宣佈 DGX Spark 64GB 配置將於 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 開售,起價 $4,999。
《華爾街日報》稱 OpenAI 解僱三名涉嫌向外部 AI 安全組織洩密的研究員;匿名 X 帳户稱安全研究員 David Robinson 隨後離職。OpenAI 發言人稱調查確認有人違反公司處理敏感資訊的規定,但公司未確認三人姓名,洩露內容及流向哪個組織也不清楚。四人都曾在 9 月公開談及 AI 風險;《華爾街日報》未將相關研究工作與解僱相連。
微軟計劃將仿生設計擴展至更多資料中心,透過原生植被、生態修復及植物緩衝帶,減輕設施對周邊社區與環境的影響。方案將推展至美國及德國超過 20 個據點,並涵蓋美國所有新項目及全球逐步增加的項目。部分居民及環保人士認為,生態修復無法抵銷資料中心擴張帶來的能源、水資源與排放壓力。
多名服務業工作者向 The Verge 表示,顧客或照護者把 ChatGPT 或 Claude 的錯誤回答當真,並提出不存在或不合適的要求。餐飲、旅遊與育兒案例包括索要餐廳沒有的酒款、按虛構營地安排旅程,以及堅持孩子的睡眠安排合適。
Amazon Web Services CEO Matt Garman 發表逾 3,000 字網誌,呼籲支持 AI 數據中心項目,並警告阻建可能對美國經濟及國家安全造成不可挽回的損害。
Suno 在網頁及手機平台推出 Speech 公測功能,可根據提示描述或自訂稿生成口語,並同步生成配樂。Simple 模式以提示描述生成,Advanced 模式可輸入自訂稿並調整 AI 聲音性別、説話風格及生成多樣性;配樂可關閉,最長時長約 8 分鐘。Suno 表示功能仍在 beta 階段,會根據用户意見持續改進。
Microsoft AI 發佈 MAI-Transcribe-2-Streaming 即時轉錄模型,以及 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 兩款文字轉語音模型。
Ramp AI Index 顯示,美國企業 AI 支出下降之際,使用量自 7 月支出見頂後增加約 50%,並於 9 月底創新高。Ramp 經濟學家 Ara Kharazian 指出,頂級模型降價及更便宜、效率更高的標準和輕量模型降低了支出,降幅幾乎全由 OpenAI 與 Anthropic 的競爭帶動。
Thore Graepel 認為,當前 LLM 的鏈式推理仍由反覆預測下一個 token 產生,並非獨立的推理機制。AlphaGo 結合神經網絡提供的直覺與棋局樹搜尋;作者指出,聊天機械人缺少可持續檢視的信念狀態,思維鏈也可能在得出答案後才編造。Graepel 主張系統維護明確的認知狀態,僅在證據支持時更新信念,並評估每一步能否降低不確定性。
Ai2 開源 AstaBrief 8B 及其訓練資料,並將這款科學報告生成模型加入 Asta 的 Fast mode。它以 Qwen3-8B 為基礎,根據研究問題和檢索到的文獻摘錄一次生成附引文報告;Asta 全流程中,Fast mode 平均每份報告需時 51.1 秒,較 Thinking mode 的 178.5 秒快約 3.5 倍。
Black Forest Labs 發佈 Flux 3 Image,作為 Flux 3 模型家族的圖像版本,並稱其多步編輯不會改動圖像其他部分。模型支援文字生成圖像、圖生圖、文字渲染和寫實圖像生成,亦可用邊界框組合場景、加入最多 10 張參考圖,並輸出最高 4K 圖像。
Martin Trust Center for MIT Entrepreneurship 建立免費 AI 平台 Dear Dreamer,向所有初中及高中學生開放,讓他們自定進度學習創業。
MIT 的 Alex Zhang 在訪談中主張,學術研究者應押注產業實驗室較少關注、初看可能微不足道或古怪的研究方向。他將 Recursive Language Models(RLMs)描述為以程式碼作為唯一工具、讓模型可以遞迴調用自身,並在程式環境中保存上下文的 harness。
OpenRouter 的指南介紹客服機械人採用低成本優先模型路由的方法,讓較小、成本較低的模型處理常見問題,並把較難或不確定的請求升級至能力較強的模型。指南比較靜態規則、分類器分流及按信心門檻檢查答案三種方式,並指出模型備援清單只會在請求出錯後重試,答案品質檢查及升級決策須由應用程式負責。指南建議比較答案接受率、包括被棄用嘗試的總成本、升級率及整輪延遲,並只在評估顯示升級能修正失敗答案時加入升級。
OpenRouter 推出 Model Router Benchmarks 頁面,透過多個領域的基準測試比較不同模型路由器的品質、速度和成本。Router Index 將三項表現合成 0 至 10 分,預設按品質 60%、每項任務耗時 20%、成本 20% 加權,用戶可調整權重。
OpenClaw 將 Tencent 的 AI-Infra-Guard(AIG)整合至 ClawScan,ClawHub 上傳的技能與外掛均納入 AIG 安全審查。
OpenRouter 的文章按工作流程編排、模型路由和供應商路由三層,對照 LangChain、LangGraph、CrewAI 與 OpenRouter 原生路由的職責。
AWS Professional Services 以 Amazon Bedrock AgentCore 部署四智能體方案,協助擴展雲端遷移並處理組織特定需求。
Aweb 的頁面標題將其描述為面向 AI 智能體的通訊,並連結至 aweb.ai。該帖在 Hacker News 獲 38 points,並有 28 則留言。
作者反駁對 AI 風險的反射式否定,主張質疑 AI 公司的説法,不應因此忽視現實危害。文中指出,近期 AI 安全事件多涉及內部測試或受控情境,部分移除了防護措施或要求模型角色扮演;目前沒有已知非 AI 公司實施同類行動的案例,相關風險亦難以獨立核實。
美國聯邦法官 Amit Mehta 駁回 Chegg 與 Penske Media 對 Google 提出的反壟斷訴訟,裁定 Google 在 AI 搜尋產品中的相關行為不違反反壟斷法。
Periscope 是免訓練推理方法,透過對局部及跨步取樣片段評分,讓凍結語言模型處理超出上下文窗口的長文本。
論文提出 CUAWright,以最小化終端介面作為數碼智能體的統一操作方式。它使用約 3K 行程式碼,以 bash 命令作為唯一操作介面,並以檔案系統動態建立工具及管理上下文。
ADSD 框架以數值診斷引導合適方法的探索,並將知識整理成可重用的求解器技能,令求解器自我改進更有系統。它在四個數值領域均提升求解器的準確度、穩健性和效率。在 GOC-500 電力潮流測試中,平均求解器誤差降低近 71 倍,改善亦轉移至未見過的電網拓撲和運行狀況。
Amazon Quick 推出 Live Data in Apps,讓已發布的 Quick Apps 每次開啟時即時查詢受治理的 Quick Sight 資料集,而非讀取建置時快照。查詢以查看者身份執行並套用其 RLS 與 CLS 權限;每位查看者首次使用每個資料集時須同意,且不支援匿名或公開存取。