跳到正文

部署工程

把模型跑起來的工程實踐:推理優化、顯存與成本、Serving 架構與基礎設施選型。

121條精選相關主題開源生態數據與訓練端側 AI

最新精選

第 61–80 條 · 共 121 條
9月23日週二
  1. OpenAI News71

    OpenAI、Oracle 與 SoftBank 擴展 Stargate,新增五個 AI 數據中心站點

    OpenAI、Oracle 與 SoftBank 宣佈 Stargate 新增五個 AI 數據中心站點,並加快美國 $500B、10-gigawatt 的基礎設施建設。該建設旨在支援下一代 AI,並創造數以萬計個職位。

    推薦理由:公告將新增五個站點放在 $500B、10-gigawatt 的美國基建計劃中,並交代其支援下一代 AI 和創造數以萬計職位的目標。

9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

9月2日週二
8月5日週二
  1. Hugging Face Blog91

    OpenAI 發佈開源 GPT OSS 模型系列

    OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。

    推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。

  2. OpenAI Developers76

    如何用 Ollama 在本地運行 OpenAI gpt-oss

    OpenAI 介紹用 Ollama 在本地運行兩款 gpt-oss 模型,支援離線聊天、API 調用及接入 Agents SDK。gpt-oss-20b 建議至少 16GB VRAM 或 unified memory,gpt-oss-120b 至少 60GB;模型預設採用 MXFP4 量化,VRAM 不足時可用 CPU,但速度較慢。

    推薦理由:指南比較兩個模型所需的硬件配置,並串起本地聊天、Chat Completions API 與 Agents SDK 接入步驟,便於評估本地部署路徑。

7月30日週三
7月22日週二
  1. OpenAI News74

    OpenAI 與 Oracle 達成協議,在美國開發 Stargate 新增 4.5 gigawatts 的數據中心容量

    Oracle 與 OpenAI 達成協議,將在美國開發 Stargate 額外 4.5 gigawatts 的數據中心容量。Stargate 是 OpenAI 的 AI 基礎設施平台,這項協議亦是該計劃的重要里程碑。OpenAI 表示,這項投資將創造新職位、加快美國再工業化並推進美國 AI 領導地位。

    推薦理由:這項協議把 Stargate 在美國的新增數據中心容量明確為 4.5 gigawatts,呈現 OpenAI 與 Oracle 推進 AI 基礎設施建設的合作規模。

  2. Hugging Face Blog61

    NVIDIA NIM 支援在 Hugging Face 部署逾 100,000 個 LLM

    NVIDIA NIM 現可透過單一 Docker 容器部署 Hugging Face 上逾 100,000 個 LLM。NIM 會自動識別模型格式、架構和量化格式,並在 NVIDIA TensorRT-LLM、vLLM 與 SGLang 間選擇後端及套用預設設定。

    推薦理由:文章展示 NIM 如何按模型格式、架構與量化方式自動選擇推理後端,並以部署示例説明從 Hugging Face 模型到 Docker 服務的操作流程。

7月10日週四
7月1日週二
  1. Hugging Face Blog64

    使用 Sentence Transformers 訓練及微調稀疏嵌入模型

    Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。

    推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。

6月11日週三
  1. Mistral AI61

    Mistral AI 推出 Mistral Compute AI 基礎設施服務

    Mistral AI 推出 Mistral Compute,提供可按客户需求配置的私有整合式 AI 基礎設施,形態涵蓋裸金屬伺服器至全託管 PaaS。服務整合 GPU、編排、API、產品及服務,將提供最新 NVIDIA 參考架構,GPU 可用量達數萬枚,並於未來數年快速擴充。

    推薦理由:Mistral Compute 將 GPU、編排、API、產品及服務整合為私有 AI 基礎設施,讓客户按需求配置,並提供由裸金屬伺服器至全託管 PaaS 的部署形態。

  2. Hugging Face Blog60

    Hugging Face 與 NVIDIA 合作推出 Training Cluster as a Service

    Hugging Face 與 NVIDIA 宣佈合作推出 Training Cluster as a Service,讓研究機構可按訓練需求申請 GPU 叢集,並按訓練運行時長付費。

    推薦理由:服務將 GPU 叢集申請、算力採購、部署和訓練排程串起來,並按訓練時長付費,呈現研究機構如何依地區、規模與訓練週期取得所需算力。

5月22日週四
5月15日週四
  1. Hugging Face Blog65

    Hugging Face Transformers 計劃推動模型定義標準化

    Hugging Face 表示,Transformers 將朝跨框架模型定義標準化發展,目標是讓其支援的模型架構更易被其他生態工具採用。目前 Transformers 支援 300+ 種模型架構,平均每週新增約 3 種;團隊計劃簡化建模程式碼和 API,並加強模組化模型定義。

    推薦理由:文章交代 Transformers 希望成為跨框架模型定義的共同基礎,並列出簡化模型貢獻流程、提升訓練與推理工具互通的具體方向。

5月7日週三
  1. Mistral AI67

    Mistral AI 發佈 Mistral Medium 3,主打效能、成本與企業部署

    Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。

    推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。

4月5日週六
3月27日週四
  1. Hugging Face Blog77

    DeepSeek-V3 0324 登上 Hugging Face Hub,四項基準分數均上升

    DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。

    推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。

3月18日週二
2月25日週二
  1. Hugging Face Blog62

    Hugging Face 推出 FastRTC,支援以 Python 建構即時音訊與影片 AI 應用

    Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。

    推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。