Google DeepMind 發佈開放、輕量級多模態嵌入模型 EmbeddingGemma 2
Google DeepMind 發佈 EmbeddingGemma 2,將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,供裝置端推理使用。
推薦理由:EmbeddingGemma 2 將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,並列出裝置端記憶體與向量儲存數據,方便評估跨模態搜尋的本地部署。
Google DeepMind 發佈 EmbeddingGemma 2,將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,供裝置端推理使用。
推薦理由:EmbeddingGemma 2 將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,並列出裝置端記憶體與向量儲存數據,方便評估跨模態搜尋的本地部署。
文章示範如何以 OpenClaw 和 Amazon Bedrock AgentCore 建構可累積上下文的 AI 助手,並以 Sprout 園藝助手展示整體架構。
推薦理由:文章以 OpenClaw 和 AgentCore 示範記憶檢索、用戶資料隔離及提示詞快取的設計,並整理可移植至其他領域的智能體部署方法。
AWS 教程示範如何在航空應用程式中,以 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova 2.5 Sonic 建立語音旅遊禮賓服務。
Amazon SageMaker Studio 現可直接在 HyperPod EKS 叢集建立及管理 Amazon SageMaker Spaces,並啟動 JupyterLab 或 Code Editor。
AWS 説明如何在 SageMaker Unified Studio 專案中提供核准的 Amazon SageMaker HyperPod 運算資源,同時讓基礎設施團隊保留叢集管理權。
Amazon SageMaker AI 推出 aws-ai-ml 技能,讓支援 MCP 的編碼智能體協助最佳化生成式 AI 推理。它可測試現有端點、推薦部署配置、比較基準測試結果,並生成可檢視及執行的 SageMaker Python SDK v3 程式碼;測試報告提供實際基礎設施負載下的吞吐量、延遲和並行數據。
Chatham Financial 使用 Codex 和 GPT-5.6 建構技術並重新設計工作流程,將交易驗證時間由 30 分鐘縮短至不足 4 分鐘。
uniopen 以 Amazon SageMaker AI 監督式微調及提示詞優化客製化 Amazon Nova 2 Lite,令兩項零售審核分類指標均達到生產門檻。
AWS Machine Learning Blog 提供 Claude Platform on AWS 多環境存取指南,示範為 AWS 工作負載、開發者筆電及外部環境配置推理存取。
推薦理由:文章按 AWS 工作負載、開發者筆電與外部環境,示範 cross-account SigV4、workspace-scoped API key 和 OIDC federation 如何配置,並維持 workspace 隔離。
OpenAI 的 GPT-6 系列模型指南説明初創企業如何選擇 GPT-6 模型、調整推理力度,並準備投入生產的工作流程。指南亦涵蓋改善提示詞與技能,以及協調工具。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。
推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。
NVIDIA 宣佈 DGX Spark 64GB 配置將於 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 開售,起價 $4,999。
AWS Professional Services 以 Amazon Bedrock AgentCore 部署四智能體方案,協助擴展雲端遷移並處理組織特定需求。
Amazon Quick 推出 Live Data in Apps,讓已發布的 Quick Apps 每次開啟時即時查詢受治理的 Quick Sight 資料集,而非讀取建置時快照。查詢以查看者身份執行並套用其 RLS 與 CLS 權限;每位查看者首次使用每個資料集時須同意,且不支援匿名或公開存取。
文章示範如何將 Amazon S3 Vectors 設為 NVIDIA NeMo Agent Toolkit(NAT)的持久記憶層,並把智能體工作流部署到 Amazon EKS。
Amazon Bedrock AgentCore 的參考實作把 Amazon S3 上傳或排程事件轉成智能體工作,並讓智能體在需要澄清、審批或覆核時暫停等待人員回應。
推薦理由:文章把事件來源、AgentCore 執行與人在迴路處理串成參考架構,並清楚區分樣本內建能力與需自行擴展的訊號來源。
Albertsons Cos. 利用 ChatGPT Enterprise 和 OpenAI API,協助團隊加快工作,並讓數百萬顧客更輕鬆地購買雜貨。
CoreWeave 宣佈在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,並推出 CoreWeave Forge,推進智能體 AI 從訓練到生產的部署。
推薦理由:文章披露 Cognition 對 Vera Rubin NVL72 與 GB200 NVL72 的 SWE-2 推理測試,列出最高 4.8x 的總 token 吞吐提升,讓兩種平台在智能體編碼工作負載下可作量化比較。
Amazon Bedrock 現已在印度提供 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,透過印度地理跨區域推理處理請求。
Microsoft 宣佈 Physical AI Toolchain 新增機械人推理卸載功能,支援透過 Kubernetes 工具把 AI 工作負載分配至機械人、邊緣 GPU 和雲端。
推薦理由:文章將實機工作負載的效能、電池續航與算力配置放在同一脈絡比較,並介紹以 Kubernetes 分配推理的工具,呈現卸載方案的收益與代價。
GPT-6 改進提示詞快取,提升快取命中率,並加入新診斷功能、明確斷點,以及可降低延遲和成本的控制項。
Hugging Face 為 Transformers 加入 GGUF 支援,讓用户可透過熟悉的 Transformers API 在本機載入量化檢查點並生成內容。
推薦理由:文章示範透過 Transformers API 從 Hub 載入 GGUF 量化檢查點,並以 Q4_K_M 等選項説明檔案大小與精度的取捨。
Mistral 與 Cloudera 建立合作,將 Mistral 模型整合至 Cloudera 混合數據平台,讓企業可在自有環境部署推理,並以專有數據訓練自訂模型。模型可部署於私有及公有雲、本地端及完全隔離環境,企業亦可保有數據與所生成智能的控制權。模型可按企業需求調整並基於開放權重持有,訓練和推理可在客户選定的基礎設施及司法管轄區內進行。
Mistral 宣佈完成 €3 billion D 輪融資,投後估值超過 €21 billion,並將藉此擴大前沿研究、訓練算力及基礎設施。本輪由 Samsung Electronics 領投,Scaleup Europe Fund(由 EQT 管理)與現有投資者 PSG Equity 共同領投;Mistral 稱這是歐洲科技公司完成過的最大股權融資。
推薦理由:融資不只用於前沿研究和訓練算力,也涵蓋基礎設施與商業拓展,呈現 Mistral 主權 AI 全棧路線的擴張重點。
Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。
推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。
Gilbert + Tobin 律師事務所以 CEO 主導的承諾、嚴謹治理及人類問責,將 ChatGPT Enterprise 與 Codex 擴展至全所。內容聚焦於這些做法如何支持 AI 規模化。
Hugging Face 推出 @huggingface/kernels JavaScript loader,並在 Hub 發布首批 207 個 WebGPU kernels。
推薦理由:文章將 207 個 WebGPU kernels 的版本化操作契約、正確性測試與基準案例一併呈現,並提供 Apple M4 上與 ORT WebGPU 的比較數據。
Polimill 建構日本新一代公共 AI 基礎設施。該公司運用 OpenAI GPT 模型及 Codex,協助地方自治體搜尋和運用行政知識,並加快開發。
OpenAI CFO Sarah Friar 闡述晶片、算力、模型與產品的進步如何相互疊加,帶來更實用、規模更大且成本更低的智能。
Jalapeño 是 OpenAI 自研的 AI 推理晶片,首批結果顯示其推理速度與能效領先業界。它為現代模型提供更快、能效更高的 AI 推理,並帶來更高吞吐量與更低延遲。
Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。
推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。
Mistral AI 與 HUMAIN 宣佈戰略合作,將在沙特阿拉伯及區域內推進 AI 基礎設施、先進模型開發和 AI 解決方案部署。雙方將開發並本地化先進 AI 模型,初期聚焦網絡安全和語音,並計劃開發阿拉伯語表現出色的前沿模型;合作規模達數億歐元。Mistral AI 將探討使用 HUMAIN 的數據中心基礎設施,雙方亦計劃在沙特制定面向受監管行業的共同市場策略。
Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。
推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支援 ColBERT 式多向量檢索。文中示範載入 PyLate 與 Stanford-NLP ColBERT checkpoint、接入檢索索引,以及以同一 API 執行 ColPali 視覺文件檢索。
推薦理由:文章對照 LateOn 與 DenseOn 在 NanoBEIR 13 個資料集的結果,並以索引體積數據呈現多向量檢索表現與儲存成本的取捨。
RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 產品開發,並集中工程與營運部門的營運情報。相關應用涵蓋工程至營運。
OpenAI 致函德州州長 Greg Abbott,闡述其對在德州負責任地發展 AI 基礎設施的承諾。信中支持可靠、透明且惠及德州居民的增長。
HSP GRUPPE 使用 ChatGPT Enterprise 提升生產力和工作質素,並為税務諮詢及客户服務創造更多容量。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
Google 在 DOE Genesis Mission Summit 2026 宣佈,將提供 $40 million 的 AI tokens 和雲端額度,支持 Genesis Mission 研究人員。
推薦理由:承諾同時涵蓋科學 AI 工具與 Gemini for Government 一年使用權,並附有顯微鏡校準時間及手動步驟的前後數據,可見資源投入如何落到實驗室工作流程。