跳到正文

#部署/工程

今日 16 條
7月30日週二
7月18日週四
  1. Hugging Face Blog63

    Hugging Face TGI 推出 Multi-LoRA 服務,部署一次即可服務 30 個模型

    Hugging Face 的 TGI 推出 Multi-LoRA serving,讓單一基礎模型可按請求動態選用不同 LoRA adapter,以一個部署服務多個微調模型。文中以 mistralai/Mistral-7B-v0.1 示範,載入 30 個 adapter 時 VRAM 增幅為 3%;實際可載入數量取決於 GPU 資源和所部署模型。

    推薦理由:文章以 TGI 的部署及調用示例,展示單一基礎模型按請求選用不同 LoRA adapter 的做法,並比較多模型部署的成本與擴展管理。

7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

  2. Hugging Face Blog60

    如何利用 distilabel 為 Argilla 2.0 建立聊天機械人

    Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。

    推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。

7月10日週三
  1. Hugging Face Blog65

    Hugging Face 與 KerasHub 宣佈共用模型保存格式

    Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。

    推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。

7月9日週二
6月12日週三
  1. Hugging Face Blog79

    Diffusers 支持 Stable Diffusion 3 Medium

    Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。

    推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。

6月7日週五
6月4日週二
5月29日週三
5月22日週三
5月21日週二
5月16日週四
5月9日週四
5月1日週三
4月23日週二
4月16日週二
  1. Hugging Face Blog59

    Zama 示範如何透過 Hugging Face Endpoints 對加密資料執行推理

    Zama 團隊示範如何透過 Hugging Face Endpoints 部署 Concrete ML 預編譯模型,讓使用者在加密資料上執行推理。文章以垃圾郵件決策樹為例,説明 Endpoint 部署、客户端設定及自製預編譯模型的流程。文中指出,CPU Endpoint 當時最多提供 8 vCPU 和 16 GB RAM,FHE 評估密鑰存於 Endpoint 的 RAM,重啟後需要重新傳送。

4月10日週三
  1. Hugging Face Blog64

    Hugging Face 推出 Deploy on Google Cloud,讓開放模型可部署至 Vertex AI 和 GKE

    Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。

    推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。

4月3日週三
2月8日週四
12月11日週一
11月3日週五
10月24日週二
  1. Hugging Face Blog70

    探索 SDXL 推理速度與記憶體的簡單優化方法

    Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。

    推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。

9月22日週五
  1. Hugging Face Blog61

    Hugging Face 推出 Inference for PROs,開放精選模型 API 端點

    Hugging Face 推出 Inference for PROs,為 PRO 用户開放精選模型的專屬 API 端點,並提高免費 Inference API 的使用速率限制。服務提供可直接使用的 HTTP 端點,方便試驗及原型開發;文章指出它不適合重型生產應用,並建議此類用途使用 Inference Endpoints。

    推薦理由:文中列出 PRO 可用的精選模型、端點呼叫方式及服務不適用於重型生產應用的邊界,便於評估其原型測試用途。

8月30日週三
8月23日週三
  1. Hugging Face Blog76

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。

    推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。

8月22日週二
  1. Hugging Face Blog57

    Hugging Face 推出企業程式碼助手方案 SafeCoder

    Hugging Face 推出 SafeCoder 企業程式碼助手方案,讓客户在自家基礎設施訓練及部署,程式碼於訓練和推理期間不離開 VPC。SafeCoder 初始版本以 StarCoder 為基礎,可按客户私有程式碼庫微調;程式碼補全建議會對照 The Stack,顯示其是否匹配資料集中的程式碼及相關授權。SafeCoder 與 VMware 合作推出,現向 VMware 企業客户提供。

8月10日週四
7月5日週三
  1. Hugging Face Blog62

    如何用 Transformers.js 製作即時機器學習網頁遊戲 Doodle Dash

    Hugging Face Blog 作者以 Transformers.js 製作 Doodle Dash,並示範如何構建可在瀏覽器本地運行的即時機器學習遊戲。遊戲模型以 Google Quick, Draw!

    推薦理由:文章串連 Quick, Draw! 數據微調、ONNX 轉換與 Transformers.js 瀏覽器推理,呈現把圖像分類模型接入即時網頁遊戲的實作路徑。

7月4日週二
7月1日週六
6月15日週四
  1. Hugging Face Blog45

    將 Livebook 筆記本部署為 Hugging Face Spaces 應用程式

    Livebook 可將筆記本部署為 Hugging Face Spaces 應用程式;示範以 Elixir 建立由 Whisper 機器學習模型驅動的語音聊天應用。應用只接受音訊訊息,並由 Whisper 自動轉成文字,整個示範流程不到 15 分鐘。Livebook 是開源的 Elixir 互動式程式碼筆記本,也可在 Spaces 免費執行,供使用者編寫及試驗筆記本。

6月13日週二
5月31日週三