Fireworks 多區域部署架構解析:單一部署支援全球擴展
Fireworks 新增 GLOBAL 多區域部署選項,讓單一部署可跨地區調度兼容容量,並以同一端點管理工作負載。排程器預先安排容量,避免每個請求都經過全球路由步驟,並遵守硬件、配額、可靠性及資料駐留限制。
Fireworks 新增 GLOBAL 多區域部署選項,讓單一部署可跨地區調度兼容容量,並以同一端點管理工作負載。排程器預先安排容量,避免每個請求都經過全球路由步驟,並遵守硬件、配額、可靠性及資料駐留限制。
Prime Intellect 推出開源編碼智能體框架 Prime Agent,以 RLM 和 Continual Harness 管理上下文及可更新的 harness 狀態。
Prime Intellect 在 verifiers 0.3.0 和 prime-rl 0.8.0 加入多智能體訓練與評估支援,並以 Agent 和 Env 抽象編排智能體互動。
Prime Intellect 正式開放 Prime Sandboxes,提供以完整 Linux 虛擬機為基礎的沙盒,支援數萬個並發實例。服務可透過 CLI/SDK 獨立使用,亦整合 verifiers、prime-rl 和 Prime Tunnels;所有帳戶預設並發上限為 1,024。
Prime Intellect 發佈 Prime Inference,為前沿開源模型提供推理服務,支援無伺服器端點及預留容量,並部署於多個數據中心的 GPU 基礎設施上。
Suno 推出 Studio 2.0,為其瀏覽器版 DAW 加入 MIDI 匯入、錄製及編輯,並可用 MIDI 片段提示音訊生成。聊天功能(beta)可從零創作樂器和人聲、協作設計插件;更新亦加入進階分軌、音訊效果和自動化曲線。Suno Premier 訂閲用戶可無限制匯出高質素(32-bit/48kHz)多軌音訊及分軌。
Suno 開放 Speech beta,這款音訊模型可將生成語音與音樂整合為同一音軌。用戶輸入構想、詩作或文字,再描述所需的聲線與音樂風格,即可創作配有原創背景音樂的口述音訊。Speech 過去一個月曾由小羣用戶測試,現向所有人開放 beta;Suno 將繼續根據社羣回饋改進。
FLUX.2 [klein] 4B 將預載於新一代 ASUS ProArt 筆電的 MuseTree 應用程式,支援裝置端圖像生成。目標是在 8GB VRAM 筆電上,即使其他專業應用程式於背景運行,也能在少於 5 秒內生成圖像;使用時無需 API 或網絡連線。
Black Forest Labs 推出 FLUX Video Upscale,可將 480p 起的影片重新生成至最高原生 4K。它原生支援 FLUX 3 輸出,並可修復模糊人臉和水、草等紋理上的網格瑕疵。
Replit 推出由 OpenAI 的 GPT-5.6 Luna 驅動的 Free Mode,日常聊天、構思和任務不再消耗 credits。Core 訂閲用戶可藉此比以往多創作 30X,並每月使用最多 30 小時聊天;Core 和 Pro 用戶的使用上限每 5 小時重設。
英國 AI Security Institute 開發並開源 Python 套件 optstop,按模型表現估計的精度或穩定程度提前停止評測抽樣。在涵蓋三類評分方式、三種預期模型表現水平,以及 MATH、GPQA Diamond 和 WritingBench 等公開基準的測試中,optstop 節省 57% 至 97% 的預定運行次數,且未影響分數估計。
Google Cloud 預覽 AlloyDB 與 Cloud SQL for PostgreSQL 17+ 的原生 BM25 索引,透過 Tiger Data 開源的 pg_textsearch 擴充功能,讓全文關鍵字搜尋直接在資料庫內執行。這可與向量搜尋組成混合搜尋,避免另設全文搜尋後端;AlloyDB 提供使用 RRF 的混合搜尋 UDF,Cloud SQL 則可用 CTE 合併搜尋結果。
Google Cloud 公佈 AlloyDB 面向 AI 智能體的資料庫架構,並開放 AlloyDB PostgreSQL for agents 預覽,主打隔離、亞毫秒儲存 I/O,以及按需求擴展至數千個節點。
Google Cloud 宣佈 AlloyDB 面向智能體的 PostgreSQL 架構現以預覽版提供,透過數秒內建立的沙盒資料庫執行查詢,並與生產工作負載隔離。沙盒實例可即時唯讀存取生產資料,並在工作完成後自動縮至零;整體架構支援每秒超過 300 萬次查詢。它亦可連接 BigQuery 與 Spark 執行 lakehouse 分析,無需複雜 ETL pipeline。
Google Cloud 正式推出 Memorystore for Valkey 9.1,較 Memorystore for Redis Cluster 最高可達 3 倍 QPS,延遲達微秒級。
Google Cloud 宣佈 Spanner Omni 正式推出,這個可自行部署的 Spanner 版本可在本地數據中心及其他雲端運行,並提供與全託管 Spanner 相同的核心能力。
Google Cloud 宣佈 Spanner queues 正式推出,將原生交易式訊息佇列整合至 Spanner,讓智能體狀態更新與下游任務在同一交易中原子提交或一併失敗。
Anthropic 為 Model Hardware Standard(MHS)啟動研究預覽,向首批科研實驗室及先進製造商提供讓 AI 智能體協調操作多種實體設備的共同規格。
Anthropic 宣佈推出 Enterprise Frontier Safeguards(EFS),結合零數據保留(ZDR)的私隱保障與自動化濫用監測。客戶可選擇將活動數據存放於自有雲端帳戶,並自行管理加密金鑰、存取政策及審計記錄;自動系統會分析滾動時間範圍內的流量,將嚴重濫用訊號直接交予客戶,Anthropic 員工毋須進行人工審查。
Anthropic 推出生命科學驗證計劃(LSVP),讓經核實的生命科學團隊及機構申請使用 Mythos、Opus 和 Sonnet,並為生物學相關工作提供較寬鬆的防護設定。
小米 MiMo 團隊的終端式編碼智能體 MiMo Code 基於 OpenCode 構建,採用 MIT 授權開源,面向長程自動化程式編寫任務。其架構以計算、記憶和跨會話演進為主軸,包含並行候選選擇、獨立完成驗證、檢查點與分層記憶。
Cerebras 為 OpenAI 正在預覽的 GPT-5.6 Sol Ultrafast 提供服務,最高可達每秒 750 個輸出 tokens。它與標準 OpenAI endpoint 使用相同的模型架構、權重、精度、上下文設定及推理設定;Cerebras WSE-3 配備 44 GB SRAM,分佈在 900,000 個核心旁,讓權重接近計算單元。
Cerebras 發佈第四代 AI 系統 CS-4,稱其推理速度最高可達 GPU 系統的 30 倍。CS-4 由三個 Wafer Scale Engine 3 Turbo 處理器構成,採用 Nexus 模組化機架,並支援由 GPU 或 ASIC 執行 prefill、再由 CS-4 解碼的分離式推理。Cerebras 稱其每瓦吞吐量最高可達 CS-3 的 10 倍,首批出貨將於本季度開始。
Baseten 已在 Hugging Face 和 Baseten Model Library 提供 NVIDIA Nemotron 3 Diarization 的批次、串流及即時説話者標記轉錄預設。
LangChain 宣佈推出 LangSmith Fine-Tuning,開放用戶透過 smithtune 將 LangSmith traces 中成功的 runs 轉成監督式微調數據集,並在 Baseten Loops 訓練模型。
Lakebase Postgres 以指定時間點建立分支來復原資料庫,Databricks 稱即使資料庫達 100 TB,復原也可在數秒內完成。新分支引用物件儲存中已有的歷史資料,不必複製資料,並配有獨立運算資源及連線字串。文章亦指出,這種操作可讓 Replit 或 v0 等 Agent 平台支援資料庫版本回退或撤銷。
Genie One 以企業業務脈絡為依據,協助財務團隊分析業績變動成因,並將重複分析轉為可重用工作流程。它依循經批准的指標、財政年度邏輯、實體架構及企業用語,且不取代財務判斷或現有控制。支援預算差異分析、現金流預測、財務結算管理及支出分析,並可將對話儲存為 Genie Agent,供團隊重用和完善。
Databricks Runtime 透過 NEAREST BY Join 將批次向量搜尋表達為 top-k 排名連接,並以 Photon 融合式 GEMM 核心執行。
華碩推出 ROG Strix OLED XG32UQDS 顯示器,採用 31.5" UHD(3840×2160)180Hz QD-OLED 面板,並覆蓋 BlackShield 低反光抗刮鍍膜。其 SDR 亮度為 250nits、HDR 峯值亮度為 450nits,灰階(GtG)反應時間為 0.03ms,並支援動態準星、動態暗影增強及 AI Visual 三項 ROG 遊戲 AI 技術。
Microsoft 為 Word 中的 Copilot 新增引用功能,回覆會附上來源連結,讓用戶可跳轉至原始網頁或內部文件核實資訊。Microsoft 表示,此舉有助提升透明度;此外,Copilot Chat 的設計與功能經過優化,Copilot App 新增插件、連接器及 Work IQ 增強功能,PowerPoint 中的 Copilot 亦新增技能與連接器。
Anthropic 的 Felix Rieseberg 表示,Cowork 新版把模型推理和 VM 都移至雲端,每個工作階段均使用不與其他工作階段共享狀態的獨立沙盒。
ChatGPT 正在把真實漫畫家的簽名加到偽造的《紐約客》漫畫中。
Google 的 Call for Me 或將擴展至親友私人電話,讓 Gemini 代用戶轉達訊息或進行簡單查詢。現有功能主要用於致電商戶及處理預約;新版介紹畫面出現「媽媽」和「約翰」等私人聯絡人示例。Google 尚未確認是否推出擴展功能,正式推出時間亦未明。
Google 或會把 Gemini 的「Call for Me」AI 功能擴展至商務電話以外,讓用戶透過電話向親友傳達簡短訊息。Android Authority 在 APK 拆解中發現「Gemini Calling」介紹畫面及 Gemini 在個別應用程式中的細緻權限選項,當中似乎包括電話權限。Google 仍可能不會公開推出這項功能擴展或相關設定。
Together AI 推出免費、採 MIT 授權的 Together Link CLI,連接六款既有工具,使用由 Together AI 託管的開放模型,目前仍處於 beta。
Nolla Health 在猶他州啟動 AI 暗瘡處方試點,居民可透過 App 掃描面部,由系統評估暗瘡嚴重程度並開具初次處方。首100名患者的每張 AI 處方須先經兩名醫生批准;下一階段最多500名患者的處方會在開出後才由醫生審查,再之後每月抽查至少10%,並審查所有涉及升級處理或副作用的個案。
OpenAI 將在歐盟為 ChatGPT 和 Codex 生成的文字加入隱形浮水印,以符合《歐盟 AI 法案》的透明度規定。浮水印將於未來數週向歐盟符合資格的 ChatGPT 和 Codex 用戶推出,涵蓋所有方案;全球開發者可從今天起在 OpenAI API 的指定模型上啟用此功能,此功能預設關閉。
PyTorch 在過去兩年整合媒體處理架構,由 TorchCodec 集中負責圖像、影片和音訊的解碼與編碼,TorchVision 和 TorchAudio 則專注處理媒體轉換。
開源命令列工具 RemoveMacAI 可從 macOS 27 移除 Apple Intelligence 功能,也可只移除不想使用的功能並保留其他功能。它透過用戶在「系統設定」批准的設定描述檔和 Apple 自家的資源服務運作,不會直接修改 /System,System Integrity Protection 亦會保持啟用。
Instinct 宣佈把 AI 智能體帶入羣組聊天,即使朋友尚未加入 Instinct,也能在羣組使用這項功能。功能目前向早期體驗用戶推出,之後將擴展至所有用戶。用戶可選擇信任哪些羣組並隨時撤回;個人 Instinct 智能體分享個人資料或採取行動前須先獲許可,羣組版 Instinct 無法存取用戶個人帳戶。