PyTorch 效能分析(第 3 部分):用 profiler 剖析 Attention
Hugging Face Blog 的《PyTorch 效能分析》第 3 篇以 profiler traces 對照手寫注意力與 PyTorch SDPA 各後端的執行情況。
推薦理由:文章對照 CPU 與 GPU trace,展示如何從 kernel 數量、資料搬移及 CPU 開銷,辨認注意力實作的效能收益與成本。
把模型跑起來的工程實踐:推理優化、顯存與成本、Serving 架構與基礎設施選型。
Hugging Face Blog 的《PyTorch 效能分析》第 3 篇以 profiler traces 對照手寫注意力與 PyTorch SDPA 各後端的執行情況。
推薦理由:文章對照 CPU 與 GPU trace,展示如何從 kernel 數量、資料搬移及 CPU 開銷,辨認注意力實作的效能收益與成本。
Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。
推薦理由:文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。
Hugging Face 與 Microsoft 將每週更新的精選開放權重模型目錄加入 Microsoft Foundry Model Catalog,並可一鍵部署至 Foundry Managed Compute。
推薦理由:文章梳理模型篩選、權重預置和執行環境掃描的上架流程,説明企業如何在私有網絡內部署而毋須連出 Hugging Face Hub。
Hugging Face Storage 現已成為 SkyPilot 的一級儲存後端,可透過 hf:// URL 將 Bucket 或 Hub 倉庫接入跨雲任務。
推薦理由:這項整合把模型與數據集的存放位置和 GPU 雲端選擇分開,並明確呈現讀取不收 egress 費與跨雲寫回仍需付費的成本差異。
Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。
推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。
Hugging Face Blog 示範用一條命令在 HF Jobs 上以 vLLM 啟動私有、OpenAI-compatible 的 LLM 端點。內容提供 curl 和 Python OpenAI client 呼叫範例,並示範以 SSH、Gradio 及 Pi 延伸使用;每次請求須附上具該 Job 讀取權限的 HF token。
推薦理由:文章把 HF Jobs、vLLM 與 OpenAI-compatible API 的部署、驗證和停止流程串成可複用命令,並説明私有端點的 token 權限與成本控制。
Mistral AI 為 Connectors 推出多項管理與安全功能,涵蓋工作區及組織層級的存取控制、具 connector scope 的 API keys、多帳户連接器,以及 MCP 連線除錯。
推薦理由:這次更新把企業連接器的權限、執行身份與故障定位納入同一套控制,呈現智能體投入組織日常工作所需的治理環節。
Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。
推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。
Hugging Face Blog 第二篇 PyTorch 效能分析教程,從 nn.Linear 追蹤至 GeGLU MLP。
推薦理由:文章對比 eager、torch.compile 與 Liger,展示 MLP 融合如何減少 HBM 往返,以及固定形狀特化與跨形狀通用的取捨。
Hugging Face Blog 示範如何把 GitHub Actions 的 CI 工作交由 Hugging Face Jobs 執行,並以 Trackio 展示透過臨時 self-hosted runner 連接兩者的方式。
推薦理由:文章給出 GitHub Actions 接入 Hugging Face Jobs 的操作流程,並説明 workflow 標籤設定。
NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。
推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。
H Company 發佈 Holo3.1 電腦操作模型系列,擴展至網頁、桌面及手機環境,並提供本地推理量化權重。AndroidWorld 上,35B-A3B 模型的分數由 67% 升至 79.3%,4B 和 9B 版本由 58% 升至 72%。
推薦理由:文章同時列出不同尺寸、量化格式,以及 AndroidWorld 和 DGX Spark 數據,讀者可據此比較本地部署的性能與速度取捨。
OpenAI 已在密歇根州為 Stargate 旗下 1GW 數據中心項目動工,以建設 AI 基礎設施。項目旨在擴大 AI 可及性、創造就業並支持當地社區。
推薦理由:可從項目規模及所列目標理解 Stargate 在密歇根州的基礎設施規劃,涵蓋擴大 AI 可及性、創造就業和支持社區。
OpenAI 宣佈,其前沿模型與 Codex 現已在 AWS 正式提供,為企業提供透過既有 AWS 環境使用 OpenAI 的途徑。企業可沿用熟悉的 AWS 控制措施及採購流程,並加快由評估走向生產。
推薦理由:這項可用性變化讓企業沿用既有 AWS 環境、控制措施及採購流程接入 OpenAI,並加快由評估推進至生產。
Hugging Face Blog 發佈 PyTorch 效能分析系列首篇入門指南,示範 torch.profiler 的設定,以及 profiler 表格和 CPU、GPU 軌跡的讀法。
推薦理由:文章以矩陣乘加示範如何結合 profiler 表格與 CPU、GPU 軌跡辨認瓶頸,並區分調度層融合與實際 GPU kernel 融合。
Hugging Face 梳理 AI 智能體常見術語,解釋 Model、Scaffolding、Harness、Agent 等概念及其區別。文中將 Harness 定義為調用模型、處理工具調用及決定何時停止的執行層,Scaffolding 則涵蓋系統提示詞、工具描述、回應解析和上下文管理等行為定義層。
推薦理由:文章以模型、Scaffolding、Harness 與 Agent 的分工建立實用心智模型,並把這套脈絡延伸至訓練術語,便於理解智能體系統的組成與相關討論。
Mistral AI 開放企業 AI 編排層 Workflows 公開預覽,讓開發者以 Python 編寫流程,並可發佈至 Le Chat 供組織成員觸發。Workflows 提供持久執行、Studio 逐步追蹤及人工審批暫停與恢復,並支援將 workers 和資料處理部署在企業自有環境。
推薦理由:Workflows 將持久執行、Studio 追蹤與人工審批整合,並支援 workers 在企業自有環境運行,呈現企業 AI 流程走向生產的部署設計。
OpenAI 更新 Agents SDK,加入原生沙盒執行與模型原生 harness。這些更新旨在協助開發者構建可跨文件和工具運作的安全、長時間運行智能體。
推薦理由:更新把原生沙盒執行和模型原生 harness 納入 Agents SDK,呈現其對安全、長時間運行智能體跨文件與工具工作的支持。
Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。
推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。
Gradio 介紹 gradio.Server,讓自訂前端可使用 Gradio 的後端能力,同時採用自選的前端框架。gradio.Server 擴展 FastAPI,提供自訂路由等功能,並加入 Gradio 的佇列、SSE 串流、並發控制和 gradio_client 相容性。
推薦理由:文章以圖像去背示例展示如何讓自訂 HTML/CSS/JS 前端透過 gradio.Server 使用 Gradio 佇列、並發控制與 ZeroGPU,提供兼顧介面自由度和後端管理的實作參考。