跳到正文

#部署/工程

今日 5 條
5月21日週二
5月16日週四
5月9日週四
5月1日週三
4月23日週二
4月16日週二
  1. Hugging Face Blog59

    Zama 示範如何透過 Hugging Face Endpoints 對加密資料執行推理

    Zama 團隊示範如何透過 Hugging Face Endpoints 部署 Concrete ML 預編譯模型,讓使用者在加密資料上執行推理。文章以垃圾郵件決策樹為例,説明 Endpoint 部署、客户端設定及自製預編譯模型的流程。文中指出,CPU Endpoint 當時最多提供 8 vCPU 和 16 GB RAM,FHE 評估密鑰存於 Endpoint 的 RAM,重啟後需要重新傳送。

4月10日週三
  1. Hugging Face Blog64

    Hugging Face 推出 Deploy on Google Cloud,讓開放模型可部署至 Vertex AI 和 GKE

    Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。

    推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。

4月3日週三
2月8日週四
12月11日週一
11月3日週五
10月24日週二
  1. Hugging Face Blog70

    探索 SDXL 推理速度與記憶體的簡單優化方法

    Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。

    推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。

9月22日週五
  1. Hugging Face Blog61

    Hugging Face 推出 Inference for PROs,開放精選模型 API 端點

    Hugging Face 推出 Inference for PROs,為 PRO 用户開放精選模型的專屬 API 端點,並提高免費 Inference API 的使用速率限制。服務提供可直接使用的 HTTP 端點,方便試驗及原型開發;文章指出它不適合重型生產應用,並建議此類用途使用 Inference Endpoints。

    推薦理由:文中列出 PRO 可用的精選模型、端點呼叫方式及服務不適用於重型生產應用的邊界,便於評估其原型測試用途。

8月30日週三
8月23日週三
  1. Hugging Face Blog76

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。

    推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。

8月22日週二
  1. Hugging Face Blog57

    Hugging Face 推出企業程式碼助手方案 SafeCoder

    Hugging Face 推出 SafeCoder 企業程式碼助手方案,讓客户在自家基礎設施訓練及部署,程式碼於訓練和推理期間不離開 VPC。SafeCoder 初始版本以 StarCoder 為基礎,可按客户私有程式碼庫微調;程式碼補全建議會對照 The Stack,顯示其是否匹配資料集中的程式碼及相關授權。SafeCoder 與 VMware 合作推出,現向 VMware 企業客户提供。

8月10日週四
7月5日週三
  1. Hugging Face Blog62

    如何用 Transformers.js 製作即時機器學習網頁遊戲 Doodle Dash

    Hugging Face Blog 作者以 Transformers.js 製作 Doodle Dash,並示範如何構建可在瀏覽器本地運行的即時機器學習遊戲。遊戲模型以 Google Quick, Draw!

    推薦理由:文章串連 Quick, Draw! 數據微調、ONNX 轉換與 Transformers.js 瀏覽器推理,呈現把圖像分類模型接入即時網頁遊戲的實作路徑。

7月4日週二
7月1日週六
6月15日週四
  1. Hugging Face Blog45

    將 Livebook 筆記本部署為 Hugging Face Spaces 應用程式

    Livebook 可將筆記本部署為 Hugging Face Spaces 應用程式;示範以 Elixir 建立由 Whisper 機器學習模型驅動的語音聊天應用。應用只接受音訊訊息,並由 Whisper 自動轉成文字,整個示範流程不到 15 分鐘。Livebook 是開源的 Elixir 互動式程式碼筆記本,也可在 Spaces 免費執行,供使用者編寫及試驗筆記本。

6月13日週二
5月31日週三
5月24日週三
5月1日週一
4月6日週四
3月14日週二
2月21日週二
11月17日週四
11月2日週三
10月21日週五
10月14日週五
10月12日週三
  1. Hugging Face Blog63

    BLOOM 推理優化實錄:延遲降低 5x、吞吐量提升 50x

    Hugging Face 團隊記錄了為 BLOOM 建置推理伺服器的優化過程,稱數週內將延遲降低 5x、吞吐量提升 50x。改用 Tensor Parallelism 後,延遲由 300ms/token 降至 91ms/token,吞吐量升至 10RPS;其後透過 torch.jit.script 和自訂 kernel 將延遲再降至 71ms/token。

    推薦理由:文章以 BLOOM 的實測串連並行策略、算子融合和批次服務的取捨,呈現大型模型推理優化中如何平衡延遲與吞吐量。

9月7日週三
  1. Hugging Face Blog57

    如何使用 Megatron-LM 訓練語言模型

    Megatron-LM 可在 NVIDIA GPU 上用於訓練 GPT2,並可將訓練後的模型轉換為 Transformers 支援的格式。教程以 110M 參數的 CodeParrot 為例,涵蓋資料預處理、8 張 GPU 訓練(約需 12 小時)及權重轉換。文章指出額外的預處理和轉換會增加時間開銷,建議將 Megatron-LM 用於預訓練或較長時間微調,而非中型模型的短期微調。

8月24日週三
  1. Hugging Face Blog54

    在 Hugging Face Spaces 中可視化蛋白質

    這篇教程示範如何在 Hugging Face Spaces 中使用 3Dmol.js 和 Gradio HTML 區塊呈現蛋白質結構。示例應用接受 4 位 PDB code 或上傳的 PDB 檔案,並透過 iframe 顯示結構。2024 年 5 月更新建議使用 Molecule3D Gradio Custom Component,讓用户可即時修改蛋白質可視化,亦更容易設定預設可視化。

8月19日週五
  1. Hugging Face Blog56

    在 Vertex AI 部署 🤗 ViT

    Hugging Face Blog 示範將 🤗 Transformers 中以 TensorFlow 實作的 ViT B/16 部署至 Vertex AI,並透過 Python SDK 建立端點及發送預測請求。文章説明模型版本管理、流量分配、監控與資源設定,並記錄 Locust 本機負載測試約發出 17230 次請求,平均延遲為 646 Milliseconds。