Cerebras 發佈第四代 CS-4,稱推理速度最高可達 GPU 系統的 30 倍
Cerebras 發佈第四代 AI 系統 CS-4,稱其推理速度最高可達 GPU 系統的 30 倍。CS-4 由三個 Wafer Scale Engine 3 Turbo 處理器構成,採用 Nexus 模組化機架,並支援由 GPU 或 ASIC 執行 prefill、再由 CS-4 解碼的分離式推理。Cerebras 稱其每瓦吞吐量最高可達 CS-3 的 10 倍,首批出貨將於本季度開始。
Cerebras 發佈第四代 AI 系統 CS-4,稱其推理速度最高可達 GPU 系統的 30 倍。CS-4 由三個 Wafer Scale Engine 3 Turbo 處理器構成,採用 Nexus 模組化機架,並支援由 GPU 或 ASIC 執行 prefill、再由 CS-4 解碼的分離式推理。Cerebras 稱其每瓦吞吐量最高可達 CS-3 的 10 倍,首批出貨將於本季度開始。
Baseten 已在 Hugging Face 和 Baseten Model Library 提供 NVIDIA Nemotron 3 Diarization 的批次、串流及即時説話者標記轉錄預設。
NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。
Thinking Machines Lab 與 NVIDIA 宣佈多年期戰略合作,計劃部署至少 1 吉瓦的下一代 Vera Rubin 系統,支援前沿模型訓練及大規模提供可自訂 AI 的平台。
Lakebase Postgres 以指定時間點建立分支來復原資料庫,Databricks 稱即使資料庫達 100 TB,復原也可在數秒內完成。新分支引用物件儲存中已有的歷史資料,不必複製資料,並配有獨立運算資源及連線字串。文章亦指出,這種操作可讓 Replit 或 v0 等 Agent 平台支援資料庫版本回退或撤銷。
Databricks 分享一套挑選首批 Genie Agents 的方法,建議團隊按五項準則評估候選工作流程,篩選適合作為試點的項目。準則涵蓋業務影響、需求頻率與重複性、數據與元數據準備度、範圍清晰度,以及治理和風險適配度;各項按 1–5 分評分,總分 20–25 可立即開發,14–19 需進一步完善,低於 14 則暫不適合。若沒有業務負責人或高層主管積極支持,即使評分高也應暫緩。
Databricks Runtime 透過 NEAREST BY Join 將批次向量搜尋表達為 top-k 排名連接,並以 Photon 融合式 GEMM 核心執行。
LG 電子北美分支與暖通空調服務企業 AIR Control Concepts 達成長期供應協議,為涉及超 5GW 規模的北美人工智能數據中心供應冷水機組。LG 的冷水機組結合離心風冷結構和製冷劑自然冷卻技術;按 LG 內部模擬,該技術每年較水冷技術節能約 30%。
空芯光纖已在寧夏中衞的智算中心之間投入商用,傳輸時延與損耗下降 30% 以上。該光纖直徑不足 0.4 毫米,內嵌 20 根微型玻璃圓柱;原文稱其傳輸速度達光速的 99.7%,傳統光纖約為 69.5%。通信工程師本月在相距 30 公里的數據中心之間首次大規模部署該光纖。
PyTorch 在過去兩年整合媒體處理架構,由 TorchCodec 集中負責圖像、影片和音訊的解碼與編碼,TorchVision 和 TorchAudio 則專注處理媒體轉換。
開源命令列工具 RemoveMacAI 可從 macOS 27 移除 Apple Intelligence 功能,也可只移除不想使用的功能並保留其他功能。它透過用戶在「系統設定」批准的設定描述檔和 Apple 自家的資源服務運作,不會直接修改 /System,System Integrity Protection 亦會保持啟用。
Amazon SageMaker AI 推出 aws-ai-ml 技能,讓支援 MCP 的編碼智能體協助最佳化生成式 AI 推理。它可測試現有端點、推薦部署配置、比較基準測試結果,並生成可檢視及執行的 SageMaker Python SDK v3 程式碼;測試報告提供實際基礎設施負載下的吞吐量、延遲和並行數據。
開源命令列工具 RemoveMacAI 可在 macOS 關閉 Apple Intelligence 功能、刪除其 AI 模型,並阻止模型再次下載。開發者稱模型約佔 12GB,工具會關閉 Siri、Writing Tools、Genmoji、Image Playground、ChatGPT 擴充功能及各項摘要,並稱 Dictation 仍可使用。
JEDEC 發佈 JESD264 矽光子學器件認證和可靠性要求,這是首份面向全行業的統一矽光器件認證與可靠性實踐規範。標準建立測試和製造控制的共同基準,並釐清代工廠、外包封測及系統開發商之間的可靠性責任。它亦規定裝配工藝、激光集成、生產控制和可追溯性要求,有助降低部署風險,支持矽光技術在高速數據中心、電信及人工智能網絡中更廣泛應用。
Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。
Amazon Web Services CEO Matt Garman 表示,Amazon 在尋求新數據中心建設批准時,已停止與政府機構使用保密協議(NDA)。
Capcom 計劃逐步將 RE Engine 發展為「AI-generation game engine」,邁向與 AI 一同創作遊戲的未來。Capcom 此前表示不會在遊戲中使用 AI 生成素材,而會聚焦以 AI 提升開發效率。
浙江已有 19.5 萬家入網外賣商家接入「明廚亮灶」監管系統,具備 AI 識別功能的攝像頭覆蓋率為 97.3%。後廚畫面同步上傳至監管平台與外賣平台,AI 識別違規後推送監管人員,再由人員短信督促商家整改。浙江省市場監督管理局餐飲服務食品安全監管處處長邵慧羣表示,非現場監管後廚環境衞生不合格率由上線時逾 28% 逐月降至 3.9%。
LG 電子計劃在美國興建全球第三座人工智能數據中心(AIDC)冷水機組工廠,並擴大韓國平澤、昌原兩座工廠的產能,相關投資合計 1,500 億韓元。美國新廠位於弗吉尼亞州温莎市,將生產空冷式 AIDC 冷水機組,預計於 2027H2 投產。相關佈局將使冷水機組產能實現北美本地化,以靈活回應當地客户需求。
HPE 於當地時間 9 月 30 日宣佈,獲得首筆 AMD「Helios」AI 機架系統訂單,訂單由 Vultr 下達,價值 12 億美元。HPE 版本的 AMD「Helios」每個機架整合 6 台 Juniper Networking QFX5252 可擴展以太網交換機托架,透過標準化高帶寬、低延遲以太網連接全部 72 個 Instinct MI455X GPU 加速器。
OpenAI 已在內部部署自研 Jalapeño ASIC,並搭配配備 1.5TB 記憶體的 AMD EPYC Turin 主機使用。
微軟 CEO 納德拉再次將 Copilot 定位為「面向工作的全新操作系統」,稱其適用於所有模型、工作場景和任務。技術拆解顯示,Copilot 桌面應用程式的主程式 copilotapp.exe 僅 4.99MB,實為重新命名的 Microsoft Edge 啟動器;安裝目錄含約 520MB 的 Edge 154,主介面由 Chromium 渲染。
Anthropic 宣佈推出 Claude Frontier Academy,計劃投入 1 億美元,於 2027 年底前培養 1 萬名前沿部署工程師。工程師先接受數天線下培訓,通過考核後再進入 12 週駐訓,並在所屬機構負責一個真實 Claude 項目。
Vellum 與 LlamaIndex 整合,讓使用者可透過 Vellum 管理提示詞,並在不修改程式碼下更新提示詞及進行版本管理。Vellum Test Suites 支援以 CSV 批量匯入測試案例,文章建議提示詞上線前執行 50–100 個測試。Vellum 的 Sandbox 可迭代提示詞、模型、提供者及參數,Deployment 則提供提示詞版本管理與請求監控。
Prem App 與 Llama Index 完成整合,結合 Prem 的自託管 AI 模型與 Llama Index 資料框架,讓開發者可將自訂資料來源連接至大語言模型。整合簡化資料攝取、索引及查詢流程,並提供免費及付費方案。
LlamaIndex 與 Ray 示範構建查詢引擎,根據 Ray 文件及網誌文章回答問題並生成洞察。流程以 Ray Datasets 平行處理索引建置,並用 Ray Serve 部署查詢引擎,涵蓋文件載入、解析、嵌入向量生成及儲存。
LlamaIndex 發佈 0.7.0,進一步模組化 LLM 應用開發,新增可獨立使用的 LLM 抽象與回應合成模組,並擴充 Document/Node 的 metadata 管理能力。
LlamaIndex 現可將 Airbyte sources 直接整合為應用程式的資料載入器。目前可用的 sources 包括 Gong、Hubspot、Salesforce。
作者使用 LlamaIndex 打造 FinSight,這款在 Streamlit LLM Hackathon 勝出的應用,可從公司年報提取洞見並生成摘要。其 Annual Report Analyzer 以 RAG 和 FAISS 記憶體向量資料庫處理年報,並把查詢拆成子問題,檢索多處脈絡。
LlamaIndex 使用 Retrieval Evaluation 比較 RAG 流程中的嵌入模型與重排序模型,並以 Hit Rate 和 MRR 評估檢索表現。
LlamaIndex 在 OpenAI Developer Day 當日為其程式庫加入對兩款新模型及多項 OpenAI 功能的支援。
推薦理由:文章列出 LlamaIndex 對新模型、Azure endpoints、嵌入向量抽象層及函數調用的支援,並附模型調用程式例子,呈現這次更新涵蓋的整合範圍。
LlamaIndex 發佈 0.9,新增用於資料匯入與轉換的 IngestionPipeline,並支援快取各轉換步驟。版本亦簡化節點解析與文字切分介面,將 LangChain 改為選裝套件,並將全域 tokenizer 改為可配置,預設採用 CL100K。此外,多模態 RAG 模組以 beta 形式推出,涵蓋多模態 LLM、嵌入及檢索。
LlamaIndex 提供使用 create-llama 生成的 RAG 全棧應用部署指南,涵蓋 Next.js serverless、Express 和 Python 三種後端。
LlamaIndex 在 2023–12–12 電子報中介紹多項產品更新,涵蓋 RAG 評測、資料管線、多模態功能及開發模板。
Na2SQL 結合 LlamaIndex、OpenAI GPT-3.5 與 Streamlit,讓使用者以自然語言查詢電商 SQLite 資料庫,並取得 SQL 查詢及結果分析。應用程式會執行生成的 SQL,並提供資料庫結構檢視器;作者使用示例電商資料庫,並提供免費及付費方案。
Tessl 的設計實踐指出,設計系統能列明元件,卻無法教會 AI 智能體如何選用元件、安排畫面層級或判斷何時不使用元件。作者把三個智能體生成的畫面在 Figma 中重新設計,再讓另一個智能體列出前後差異,從重複出現的改動提煉可檢查的構圖規則。
作者用 AWS 搭建 LlamaIndex 的可擴展索引 ETL 流程,並採用 Hugging Face 的 Text Embedding Interface(TEI)提供 embeddings。
LlamaIndex 與 OpenLLM 結合,可構建基於自訂語料、能理解並回應查詢的智能查詢回應系統。示例以 OpenLLM 啟動本地 Llama 2 7B 服務,並由 LlamaIndex 管理及檢索私有、特定領域資料。若使用 vLLM 後端,需配備 Ampere 或更新架構的 GPU 及 CUDA 11.8。
LlamaIndex 的教程示範如何用 LlamaIndex、Qdrant 和 Render 建立並部署 Slack 聊天機械人,讓它從工作區對話記錄資訊並回答相關問題。機械人把未提及它的訊息存入索引,將提及它的訊息作為查詢;Qdrant 用來持久保存記憶,FixedRecencyPostprocessor 配合最多 20 條檢索結果,令較新的訊息優先。
LlamaIndex 與 Zilliz Cloud Pipelines 整合,讓開發者以託管檢索服務構建可擴展的 RAG 應用。示範以 30 行程式碼構建支援 metadata filtering 的多租户 RAG 聊天機械人,並可不改程式碼由一名用户擴展至數百萬名用户。