Meta 開源 Rebalancer:C++ 指派問題求解器每日處理約 4,000 萬個問題
Meta 開源 Rebalancer,這個採 Apache 2.0 授權、提供 Python 介面的 C++ 程式庫,可在限制和目標條件下將物件分配至不同箱位。
Meta 開源 Rebalancer,這個採 Apache 2.0 授權、提供 Python 介面的 C++ 程式庫,可在限制和目標條件下將物件分配至不同箱位。
OpenSSH 團隊於 2026-10-06 發佈 OpenSSH 10.6,並表示暫時會更頻密地發佈版本,讓錯誤修正更快交付用戶。版本停用 LZ77 字典壓縮,以緩解共享壓縮字典造成的 SSH 多通道側信道洩漏,並指出此舉會降低 Compression 選項的效果。版本亦新增混合後量子簽名演算法 ssh-mldsa44-ed25519,並加強命令列用戶名稱檢查,拒絕含反斜線或美元符號的名稱。
Google Cloud Run 可讓用戶免費領取易記、全球可用的自訂子網域,為示範應用及 AI 原型建立可分享網址。部署只需一條命令,毋須設定負載平衡器、DNS 記錄或 CNAME;Cloud Run 會自動處理 SSL/TLS 憑證及全球路由。
SpaceX 計劃集資 400 億美元採購 NVIDIA AI 晶片,《金融時報》稱融資將由阿波羅全球管理牽頭,交易預計於 2027 年完成。融資方案包括約 100 億美元銀行貸款及 300 億美元投資級債券,Pimco 亦正洽談參與出資。SpaceX 先前發行的債券曾因市場憂慮其債務和資本開支而遭拋售;2056 年到期債券目前價格約為面值的 85 美分,收益率較美國國債高約 2.27 個百分點。
GitHub 正重建 Git 基礎設施,以支援開發者與智能體在高提交量倉庫中的並行協作。新架構將權威資料存於 Azure Blob Storage,並把儲存與計算分層,讓讀取容量獨立擴展;推送流程中只保留參照更新所需的協調。GitHub 表示,內部基準測試中寫入吞吐量最高提升 35 倍。
Google DeepMind 發佈 EmbeddingGemma 2,將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,供裝置端推理使用。
推薦理由:EmbeddingGemma 2 將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,並列出裝置端記憶體與向量儲存數據,方便評估跨模態搜尋的本地部署。
雲端服務商 Lambda 正籌集最多 $4 billion,投前估值為 $14.5 billion,這可能是其計劃於 2027 年 IPO 前最後一輪私人融資,由 Coatue Management 與 Blackstone 領投。
文章示範如何以 OpenClaw 和 Amazon Bedrock AgentCore 建構可累積上下文的 AI 助手,並以 Sprout 園藝助手展示整體架構。
推薦理由:文章以 OpenClaw 和 AgentCore 示範記憶檢索、用戶資料隔離及提示詞快取的設計,並整理可移植至其他領域的智能體部署方法。
Polars 發佈 2.0,在 LazyFrame 上呼叫 collect 時會預設使用串流引擎,並預設啟用 out-of-core(磁碟溢出),另加入一級 SQL 支援及 Map dtype。
DeepSeek 本週在 HuggingFace 開放 DeepSeek-V4.1-Flash 權重,並已透過 Baseten Model APIs 提供;其 CED 架構在預填充階段啟用 8B 參數,在解碼階段啟用 16B。
Google DeepMind 發佈 EmbeddingGemma 2,一款 740M 參數的開放權重多模態嵌入模型,可將文字、圖像、影片影格及音訊映射至同一向量空間。
AWS 教程示範如何在航空應用程式中,以 Amazon Bedrock AgentCore、Amazon Bedrock Knowledge Bases 和 Amazon Nova 2.5 Sonic 建立語音旅遊禮賓服務。
Amazon SageMaker Studio 現可直接在 HyperPod EKS 叢集建立及管理 Amazon SageMaker Spaces,並啟動 JupyterLab 或 Code Editor。
AWS 説明如何在 SageMaker Unified Studio 專案中提供核准的 Amazon SageMaker HyperPod 運算資源,同時讓基礎設施團隊保留叢集管理權。
Mistral AI 發佈 Mistral Large 4(ML4)公開預覽版,用戶即日起可在 Mistral Studio 體驗預覽版 API,模型權重將於月底開放下載。
這項 SoK 研究整理 139 個語義決策引擎論文系列,評估其用於網絡控制迴路的證據。50 個系列聲稱符合控制迴路或時間預算要求,只有 4 個有配對測量支持;全部系列中也只有 4 個報告達成期限。缺乏確定性計算步驟的 72 個系列提出 22 項聲稱,均無支持,只有 2 個指定覆蓋責任人。
IFCO 數據團隊與 Databricks Forward Deployed Engineering 合作優化大型 dbt 項目的增量處理,將核心語義層每日執行時間由約 7 小時降至 2 小時 20 分鐘,並取消夜間全量刷新。
AI Unified Process 以系統用例和領域模型作核心規格,讓 Agent 直接根據系統用例生成業務軟件,省略規劃與任務拆分階段。現代化項目先從舊系統逆向整理用例、實體模型、測試和文件,再交由業務人員審核,按行為生成新實作,而非直接轉換舊程式碼。生成流程配合技能、防護規則、架構指引、MCP 伺服器和測試,並按風險安排審查。
開發者 Niko1221 開源 Strata 引擎,讓 12GB 及以上 VRAM 的消費級顯示卡可運行量化版、參數量為 125B 的 Qwen3.8-Flash-Next。
Cohere 將企業平台 North 2 改造成 AI 智能體控制中心,支援智能體自行處理多步工作流程、跨工作階段保留上下文,並接入不同模型。其協調系統可調用共享知識庫及可重用技能、連接 Slack、SharePoint 和 Jira,亦可根據聊天提示詞生成簡報、儀錶板及簡單應用程式。
UK AI Security Institute 的研究提出 RepliBench,透過 20 項 LLM 智能體評測衡量 AI 系統的自主複製能力。研究測試 7 個前沿模型,最佳模型在 15/20 個任務系列取得 >50% pass@10,在最難變體的 9/20 個任務系列達到此水平;沒有模型能完成自主複製所需的全部組成任務。
英國 AI Security Institute 與多名合作者撰寫《An Example Safety Case for Safeguards Against Misuse》,提出一種把防護措施評估連結至部署風險判斷的安全論證框架。
英國 AI Security Institute 發佈並開源 Inspect Sandboxing Toolkit,供研究人員在隔離環境中進行 AI 智能體評估。
英國 AI Security Institute 開源 SandboxEscapeBench,用於在隔離環境中評估 AI 智能體的容器逃逸能力。基準涵蓋18種橫跨編排、執行階段及核心層的情境,每個容器均在加固虛擬機內運行。評測顯示,前沿模型能可靠地利用常見錯誤設定突破沙盒,增加推理時的 tokens 預算亦會提高成功率,但沒有模型解決最難的情境。
英國 AI Security Institute 發佈 AISI Engineering Playbook,整理其評估前沿 AI 系統時建立的方法與實踐。手冊將評估所需基建分為 Evaluate、Isolate、Connect、Run 和 Scale 五層,並提供技術介紹及現有開源程式碼連結。研究人員可採用個別組件,機構亦可參照五層架構建立自己的評估平台。
Rox 採用 Cerebras Inference,為銷售 AI 智能體工作流程的 Fast Path 提供低延遲推理,令 Command 對話、語音及即時研究互動更迅速。Rox 表示,回應速度較先前方案快 10-20x;Cerebras Inference 現可透過 AWS Marketplace 按 token 計費使用,毋須部署基建。
OpenAI 與 Cerebras 簽訂多年協議,將分階段部署 750 megawatts 的 Cerebras 晶圓級系統,為 OpenAI 客戶提供服務。部署將於 2026 年開始;Cerebras 稱這將成為全球最大高速 AI 推理部署。Cerebras 表示,其系統上的大語言模型在編碼智能體或語音聊天場景中,回應速度較基於 GPU 的系統快達 15×。
推薦理由:文章列出 750 megawatts 的部署規模,並引述 Cerebras 稱其推理回應較 GPU 系統快達 15×,呈現合作的規模與方案定位。
Cerebras 在 Cerebras Inference 推出 Multi-LoRA,支援團隊以單一共享基礎模型搭配多個 LoRA 適配器,並按每次請求切換適配器。該功能支援以 HF PEFT 格式部署 LoRA,現正向 Cerebras Inference 專用端點用戶提供私人預覽,毋須額外付費。團隊可按領域、任務、客戶及工作流程專門調整模型行為。
DeepSeek 為 DeepSeek Harness 推出 v0.2 預覽版官方桌面應用程式,支援 macOS(Apple silicon)及 Windows(64-bit)。
Aleph Alpha 發佈 Kolibri(Kolibri-1),一款面向英語和德語的開放權重 MoE 語言模型,總參數為 78.1B,每個 token 啟用 3.46B。
Eugene Yan 提出產品評測的三步流程:標註小型數據集、校準 LLM 評估器,並在每次配置變更後執行實驗與評測。他建議採用二元標籤,在 200 個以上樣本中準備 50–100 個失敗案例,並以 75% 樣本校準、25% 留作測試;不同評測維度應使用獨立評估器。
ElevenLabs 與烏克蘭政府簽署諒解備忘錄,合作推動 AI 公共服務由概念走向部署。教育部團隊正開發 Mriia 個人化 AI 導師應用程式,經濟部則把智能體整合至 Obriy,醫療領域運用語音技術減少行政工作。烏克蘭數碼轉型部計劃於 2030 年前成為 AI 公共服務應用的領先者,並以 Diia.AI 踏出第一步;該平台是全球首個公共服務智能體應用程式及平台。
Zyphra 提出 Tree Attention,以樹狀歸約平行化多 GPU Transformer 解碼,實測可提升長上下文注意力的解碼速度並降低記憶體開銷。Zyphra 估算,在 1M 序列長度下,Tree Attention 的解碼速度較 Ring Attention 快逾 8x,通訊量則減至一半或更低。其跨裝置複雜度為對數級,而 Ring Attention 為線性級。
Prime Intellect 探討全球分散式訓練方法,説明如何整合各地 GPU 資源訓練 AI 模型。文中介紹 Google DeepMind 的 DiLoCo,利用內外層最佳化,讓各運算島約每 500 次更新才同步梯度,以減少通訊負擔。全球部署仍要應對頻寬有限、硬件規格不一、算力變動及容錯等問題。
Prime Intellect 將 Prime Intellect Compute 全面公開,作為聚合及調度全球 GPU 資源的算力交易平台。平台已整合 12 個雲端供應商,用戶可即時按需使用最多 8 張 GPU;H100 按需價格為 $1.5-4/hr。
Fireworks AI 已在其平台提供 Kimi K3 推理與訓練,並推出以 Kimi K3 起步的美國境內 Serverless 端點。Kimi K3 有 2.8T 參數;端點提供美國境內推理及零資料保留,Fireworks 對開放模型預設不記錄或儲存提示詞及生成數據,除非用戶明確選擇加入。
Prime Intellect 提出 TOPLOC,以局部敏感雜湊驗證 LLM 推理,並在實驗中以 100% 準確率檢測模型、提示詞或計算精度遭未授權修改。TOPLOC 將最後隱藏狀態的 top-k 特徵編碼成證明並透過重算驗證,驗證速度最高可達原始推理速度的 100×,生成證明的儲存開銷減少 1000×。
Prime Intellect 預覽面向消費級 GPU、為公共互聯網 100ms 延遲設計的分散式推理堆疊,並開源三個研究程式碼庫。PRIME-IROH 是管線並行通訊後端,PRIME-VLLM 是可在公共網絡運行的 vLLM 管線並行整合,PRIME-PIPELINE 是快速驗證研究構想的精簡研究沙盒;用戶現已可連接私人硬件,透過公共網絡執行推理。
Fireworks AI 宣佈 Training API 與 Fireworks Lab 正式開放,並讓團隊可接入自訂訓練迴圈。API 由 Fireworks 管理分散式訓練與 rollout 基礎設施,用戶可在 Python 中掌控訓練迴圈、損失或獎勵、資料及環境。
Prime Intellect 推出 Lab,將 Environments Hub、Hosted Training 和 Hosted Evaluations 整合為模型後訓練研究的全棧平台。平台現支援基於 prime-rl、使用 LoRA 的智能體強化學習訓練,並可在自建環境中執行。私測期間已完成逾 3,000 次 RL runs,現已向所有人開放。