跳到正文

部署工程

把模型跑起來的工程實踐:推理優化、顯存與成本、Serving 架構與基礎設施選型。

121條精選相關主題開源生態數據與訓練端側 AI

最新精選

第 41–60 條 · 共 121 條
3月16日週一
  1. Manus:Blog78

    Manus 推出桌面應用程式核心功能「我的電腦」,連接雲端智能體與本機資源

    Manus 推出桌面應用程式核心功能「我的電腦」,讓雲端智能體透過終端命令讀取、分析和編輯本機檔案,並啟動及控制本機應用程式。用户可新增並授權本機資料夾;執行每項命令前須明確批准,亦可選擇「始終允許」或「僅允許一次」。該功能現已向 macOS 和 Windows 用户開放。

    推薦理由:Manus 將雲端智能體延伸至本機檔案與應用程式,並透過命令授權讓自動化能力與用户對本機操作的控制並存。

3月9日週一
  1. Hugging Face Blog68

    LeRobot 發佈 v0.5.0,擴展機械人硬件、策略模型及資料與模擬功能

    LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。

    推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。

2月27日週五
2月20日週五
  1. Hugging Face Blog76

    GGML 團隊加入 Hugging Face,支持 llama.cpp 及 Local AI 長期發展

    GGML 團隊加入 Hugging Face,並將持續維護 llama.cpp;Hugging Face 會為項目提供長期資源支持。團隊仍將 100% 時間用於維護,並對技術方向及社羣保有完全自主權與領導權;項目會繼續 100% 開源並由社羣推動。雙方計劃讓 transformers library 的模型定義更順暢地用於 llama.cpp,並改善 ggml 軟件封裝及本地模型部署體驗。

    推薦理由:文章交代 GGML 團隊加入後 llama.cpp 的維護自主權與資源支持,也列出連接 transformers library 模型定義及改善本地部署體驗的方向。

2月9日週一
1月22日週四
  1. Mistral AI60

    Mistral AI 分享 vLLM 記憶體洩漏的排查與修復過程

    Mistral AI 團隊追查 vLLM 分離式服務的記憶體洩漏,定位到 UCX 的 mmap hook 與延後清理的記憶體池。問題只在使用 NIXL 的 Prefill/Decode 分離式設定中重現;設置 UCX_MEM_MMAP_HOOK_MODE=none 可解決洩漏,且在此 vLLM 用例中不影響效能。

    推薦理由:這篇排查記錄示範如何從 RSS 與匿名映射的異常增長開始,逐步利用 BPFtrace 和 GDB 定位 UCX mmap hook,並整理 vLLM 分離式服務可用的修復設定。

1月14日週三
1月9日週五
12月11日週四
  1. Hugging Face Blog68

    llama.cpp server 新增路由模式,支援無需重啟切換多個模型

    llama.cpp server 現已提供 router mode,可在不重啟的情況下動態載入、卸載及切換多個模型。它會從 llama.cpp 快取或指定的 --models-dir 尋找 GGUF,並在收到請求時載入模型;達到 --models-max 上限時按 LRU 卸載,預設最多同時載入 4 個模型。各模型以獨立程序運行,一個模型崩潰不會影響其他模型。

    推薦理由:多進程隔離配合按需載入和 LRU 卸載,展示 llama.cpp 如何在同一服務中管理多個模型並限制同時載入數量。

12月4日週四
  1. Hugging Face Blog72

    Hugging Face Skills 讓 Claude Code 微調開源大語言模型

    Hugging Face Skills 讓 Claude Code 等編碼智能體透過對話處理模型微調,涵蓋資料集驗證、GPU 選擇、雲端工作提交與進度監控。它亦兼容 Codex 和 Gemini CLI;文中以 Qwen3-0.6B 在 open-r1/codeforces-cots 上進行 SFT 為例,估算使用 t4-small 約需 20 分鐘、成本約 $0.30。

    推薦理由:文章將資料集驗證、GPU 選擇、雲端工作提交與進度監控串成智能體訓練流程,並比較 SFT、DPO、GRPO 的適用場景。

12月1日週一
11月13日週四
11月3日週一
  1. OpenAI News76

    OpenAI 與 AWS 宣佈為期多年的 $38 billion 戰略合作

    OpenAI 與 AWS 宣佈達成一項為期多年的 $38 billion 戰略合作,以擴展先進 AI 工作負載。AWS 將提供一流基礎設施及運算容量,支援 OpenAI 下一代模型。

    推薦理由:這項多年期合作把 AWS 的基礎設施與運算容量,對應到 OpenAI 擴展先進 AI 工作負載及支援下一代模型的需求,呈現雙方合作的資源配置方向。

10月30日週四
  1. Google Research62

    Google Research 公佈 PPI 系統,以差分私隱分析生成式 AI 使用情況

    Google Research 公佈可證明私隱洞察(PPI)系統,結合 LLM、TEE 與差分私隱分析生成式 AI 工具的真實使用情況,只釋出匿名化聚合結果。

    推薦理由:文章將 LLM 結構化摘要、TEE 內的資料隔離與 user-level 差分私隱聚合串成可外部檢查的流程,並以 Pixel Recorder 説明實際部署方式。

10月24日週五
  1. Hugging Face Blog75

    LeRobot v0.4.0 升級開源機械人學習工具鏈

    LeRobot 發佈 v0.4.0,加入 Datasets v3.0、VLA 模型 PI0 和 PI0.5、GR00T N1.5,以及硬件插件系統。Datasets v3.0 採用分塊 episode 格式並支援串流,可處理 OXE 級(> 400GB)資料集。

    推薦理由:資料集規模化、模擬評測、多 GPU 訓練和硬件插件同時更新,勾勒出 LeRobot 從資料處理到機械人控制的工具鏈演進。

10月21日週二
  1. Hugging Face Blog67

    用開放模型提升 OCR 流程

    Hugging Face 更新開放 OCR 模型指南,加入 Chandra、OlmOCR-2 及模型在 OlmOCR Benchmark 的比較分數。指南對照多款模型的輸出格式、語言支援、功能與成本,並介紹 OmniDocBenchmark、OlmOCR-Bench 和 CC-OCR 等評測基準。

    推薦理由:文章對照模型能力、輸出格式、評測基準與部署成本,並建議以代表性樣本檢驗不同文件和語言下的表現。

10月15日週三
10月13日週一
  1. OpenAI News78

    OpenAI 與 Broadcom 宣佈合作部署 10 gigawatts OpenAI 設計的 AI 加速器

    OpenAI 與 Broadcom 宣佈多年合作,計劃在 2029 年前部署 10 gigawatts 的 OpenAI 設計 AI 加速器。雙方亦將共同開發下一代系統及以太網方案,以支援可擴展且具能源效益的 AI 基礎設施。

    推薦理由:這項多年合作把加速器部署、下一代系統共同開發與以太網方案連在一起,呈現其 AI 基礎設施建設所涵蓋的環節。

10月6日週一
  1. OpenAI News79

    AMD 與 OpenAI 宣佈多年戰略合作,計劃部署 6 gigawatts AMD Instinct GPUs

    AMD 與 OpenAI 宣佈多年合作,計劃部署 6 gigawatts AMD Instinct GPUs,以支援 OpenAI 下一代 AI 基礎設施並加快全球 AI 創新。部署將於 2026 年從 1 gigawatt 開始。

    推薦理由:合作涵蓋 6 gigawatts AMD Instinct GPUs,並安排 2026 年先部署 1 gigawatt,呈現 OpenAI 下一代 AI 基礎設施的建置規模與時間節點。

10月1日週三
  1. OpenAI News61

    Samsung 與 SK 加入 OpenAI 的 Stargate 計劃,擴大全球 AI 基礎設施

    Samsung 與 SK 加入 OpenAI 的 Stargate 計劃,以擴大全球 AI 基礎設施。合作將擴充先進記憶體晶片產能,並在韓國建設新一代數據中心。

    推薦理由:合作內容同時涵蓋先進記憶體晶片產能擴大與韓國新一代數據中心建設,呈現 Stargate 推進全球 AI 基礎設施的兩條實體建設路徑。