跳到正文

#部署/工程

今日 15 條
5月1日週一
4月6日週四
3月14日週二
2月21日週二
11月17日週四
11月2日週三
10月21日週五
10月14日週五
10月12日週三
  1. Hugging Face Blog63

    BLOOM 推理優化實錄:延遲降低 5x、吞吐量提升 50x

    Hugging Face 團隊記錄了為 BLOOM 建置推理伺服器的優化過程,稱數週內將延遲降低 5x、吞吐量提升 50x。改用 Tensor Parallelism 後,延遲由 300ms/token 降至 91ms/token,吞吐量升至 10RPS;其後透過 torch.jit.script 和自訂 kernel 將延遲再降至 71ms/token。

    推薦理由:文章以 BLOOM 的實測串連並行策略、算子融合和批次服務的取捨,呈現大型模型推理優化中如何平衡延遲與吞吐量。

9月7日週三
  1. Hugging Face Blog57

    如何使用 Megatron-LM 訓練語言模型

    Megatron-LM 可在 NVIDIA GPU 上用於訓練 GPT2,並可將訓練後的模型轉換為 Transformers 支援的格式。教程以 110M 參數的 CodeParrot 為例,涵蓋資料預處理、8 張 GPU 訓練(約需 12 小時)及權重轉換。文章指出額外的預處理和轉換會增加時間開銷,建議將 Megatron-LM 用於預訓練或較長時間微調,而非中型模型的短期微調。

8月24日週三
  1. Hugging Face Blog54

    在 Hugging Face Spaces 中可視化蛋白質

    這篇教程示範如何在 Hugging Face Spaces 中使用 3Dmol.js 和 Gradio HTML 區塊呈現蛋白質結構。示例應用接受 4 位 PDB code 或上傳的 PDB 檔案,並透過 iframe 顯示結構。2024 年 5 月更新建議使用 Molecule3D Gradio Custom Component,讓用户可即時修改蛋白質可視化,亦更容易設定預設可視化。

8月19日週五
  1. Hugging Face Blog56

    在 Vertex AI 部署 🤗 ViT

    Hugging Face Blog 示範將 🤗 Transformers 中以 TensorFlow 實作的 ViT B/16 部署至 Vertex AI,並透過 Python SDK 建立端點及發送預測請求。文章説明模型版本管理、流量分配、監控與資源設定,並記錄 Locust 本機負載測試約發出 17230 次請求,平均延遲為 646 Milliseconds。

8月17日週三
  1. Hugging Face Blog84

    Hugging Face Transformers、Accelerate 與 bitsandbytes 的大規模 8-bit 矩陣乘法入門

    Hugging Face 將 LLM.int8() 整合至 Transformers 與 Accelerate,透過混合 INT8/FP16 矩陣乘法降低大型語言模型推理所需的記憶體。

    推薦理由:文章串連 LLM.int8() 的離羣特徵處理、效能比較與 Transformers 整合細節,呈現 8-bit 量化降低大型模型記憶體需求的實作脈絡。

8月12日週五
  1. Hugging Face Blog60

    Hugging Face 的 TensorFlow 設計理念

    Hugging Face 説明 Transformers 的 TensorFlow 設計取向,將模型和層設為 Keras Model 與 Keras Layer,讓使用者可直接調用 fit()、compile() 和 predict()。

    推薦理由:文章梳理 Hugging Face Transformers 對 TensorFlow 的六項設計取向,並以 Keras 訓練、資料管線、XLA 與部署示例,呈現這些取捨如何落實到模型訓練和部署流程。

8月11日週四
7月25日週一
7月7日週四
  1. Hugging Face Blog42

    Twitter 情感分析入門指南

    Hugging Face 提供 Twitter 情感分析入門指南,示範適用於程式開發者與非程式開發者的操作流程。程式開發者可用 Tweepy 收集推文,透過 Inference API 分析正面、負面或中性情緒,並將結果視覺化;非程式開發者則可用 Zapier 分析推文,並將結果傳送至 Google Sheets。

6月22日週三
6月15日週三
6月2日週四
5月26日週四
  1. Hugging Face Blog45

    Graphcore 與 Hugging Face 推出新一批適用於 IPU 的 Transformers 模型

    Graphcore 與 Hugging Face 擴大 Hugging Face Optimum 的 IPU-ready Transformers 陣容,現提供涵蓋自然語言處理、語音及電腦視覺的 10 款模型。各模型附有 IPU 設定檔,以及可直接使用的預訓練和微調權重。開源函式庫 Hugging Face Optimum 提供針對 Graphcore IPU 最佳化的現成模型,方便開發者使用。

4月25日週一
  1. Hugging Face Blog61

    Hugging Face 示範以機器學習篩選不滿意客户訊息

    文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。

    推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。

4月13日週三
3月16日週三
9月14日週二
7月8日週四
4月20日週二
  1. Hugging Face Blog58

    Hugging Face 解説 BERT 在 CPU 上的推理擴展(第一部分)

    Hugging Face 首篇系列文章以 BERT 為例,測試並分析 CPU 核心配置、NUMA 親和性與多模型實例如何影響推理延遲及吞吐量。結果顯示,小型及中型問題使用單一 socket 通常延遲較佳,大型問題則可利用雙 socket;多實例方案的吞吐量接近線性擴展。文中舉例,8 核實例為 0.808$/h,48 核機器則為 4.848$/h,前者成本降低 6x。

4月16日週五
  1. Hugging Face Blog63

    Hugging Face 推出 Accelerate,簡化 PyTorch 分散式訓練與混合精度支援

    Hugging Face 推出 Accelerate,PyTorch 訓練腳本加入五行程式碼後,即可支援不同分散式設定及混合精度訓練。Accelerate 提供統一 API,準備模型、最佳化器及 DataLoader,並處理裝置配置和反向傳播。

    推薦理由:Accelerate 將 PyTorch 分散式訓練及混合精度所需樣板封裝成少量 API 改動,並提供統一啟動器,呈現減少訓練腳本跨環境改動的實作方式。

3月23日週二
  1. Hugging Face Blog60

    Hugging Face 與 Amazon 宣佈戰略合作,推出 Amazon SageMaker Deep Learning Containers

    Hugging Face 與 Amazon 宣佈戰略合作,推出 Hugging Face Deep Learning Containers,讓用户可在 Amazon SageMaker 訓練 Hugging Face Transformer 模型。

    推薦理由:文章展示 Hugging Face 模型在 SageMaker 的訓練接入方式,並稱 SDK 擴展可把實驗設定與執行所需時間由數天縮至數分鐘。

2月9日週二
1月26日週二
1月25日週一
1月30日週四
7月22日週一
  1. OpenAI News88

    Microsoft 向 OpenAI 投資 $1 billion,並合作建設 AGI 平台

    Microsoft 向 OpenAI 投資 $1 billion,並合作在 Microsoft Azure 建設可擴展至 AGI 的硬件與軟件平台。雙方將共同開發新的 Azure AI 超級計算技術,Microsoft 亦會成為 OpenAI 的獨家雲端供應商。雙方還將共同進一步擴展 Microsoft Azure 支援大規模 AI 系統的能力。

    推薦理由:這項合作涵蓋投資、Azure AI 超級計算技術開發與獨家雲端供應,呈現 OpenAI 建設 AGI 平台所涉及的資金、技術與雲端合作安排。

11月15日週二
8月29日週一