Hugging Face Transformers、Accelerate 與 bitsandbytes 的大規模 8-bit 矩陣乘法入門
Hugging Face 將 LLM.int8() 整合至 Transformers 與 Accelerate,透過混合 INT8/FP16 矩陣乘法降低大型語言模型推理所需的記憶體。
推薦理由:文章串連 LLM.int8() 的離羣特徵處理、效能比較與 Transformers 整合細節,呈現 8-bit 量化降低大型模型記憶體需求的實作脈絡。
Hugging Face 將 LLM.int8() 整合至 Transformers 與 Accelerate,透過混合 INT8/FP16 矩陣乘法降低大型語言模型推理所需的記憶體。
推薦理由:文章串連 LLM.int8() 的離羣特徵處理、效能比較與 Transformers 整合細節,呈現 8-bit 量化降低大型模型記憶體需求的實作脈絡。
Hugging Face 推出 Skops,這個程式庫可將 scikit-learn 模型託管至 Hugging Face Hub,並建立模型卡以記錄模型資訊及促進協作。
Hugging Face 説明 Transformers 的 TensorFlow 設計取向,將模型和層設為 Keras Model 與 Keras Layer,讓使用者可直接調用 fit()、compile() 和 predict()。
推薦理由:文章梳理 Hugging Face Transformers 對 TensorFlow 的六項設計取向,並以 Keras 訓練、資料管線、XLA 與部署示例,呈現這些取捨如何落實到模型訓練和部署流程。
Hugging Face Blog 示範如何以 Docker 和 TensorFlow Serving,將 🤗 Transformers 的 Vision Transformer(ViT)部署至 Kubernetes。
Hugging Face Transformers 的 Vision Transformer(ViT)圖像分類模型,可使用 TensorFlow Serving 在本機部署並透過 REST 或 gRPC 提供服務。教程將圖像解碼、縮放至 224×224、正規化及分類後處理整合至 SavedModel,使其接收 base64 編碼圖像並輸出分類標籤和信心度。
Hugging Face 提供 Twitter 情感分析入門指南,示範適用於程式開發者與非程式開發者的操作流程。程式開發者可用 Tweepy 收集推文,透過 Inference API 分析正面、負面或中性情緒,並將結果視覺化;非程式開發者則可用 Zapier 分析推文,並將結果傳送至 Google Sheets。
Hugging Face 示範了將 Transformers 模型匯出為 ONNX 的三種方法,涵蓋低階 `torch.onnx`、中階 `transformers.onnx` 和高階 Optimum。
Hugging Face 宣佈 Intel 加入其 Hardware Partner Program,雙方將透過 Optimum 加速 Transformers 訓練、微調和推理。示例以 Optimum Intel 對微調後的 DistilBERT 分類模型進行訓練後動態量化,準確率由 0.574 降至 0.546,評估步驟快 1.34x。
Cohere、OpenAI 與 AI21 Labs 制定了一套初步最佳實踐,適用於任何開發或部署大型語言模型的組織。
Graphcore 與 Hugging Face 擴大 Hugging Face Optimum 的 IPU-ready Transformers 陣容,現提供涵蓋自然語言處理、語音及電腦視覺的 10 款模型。各模型附有 IPU 設定檔,以及可直接使用的預訓練和微調權重。開源函式庫 Hugging Face Optimum 提供針對 Graphcore IPU 最佳化的現成模型,方便開發者使用。
文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。
推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。
Hugging Face《Machine Learning Experts》專訪 Lewis Tunstall,談其 Transformers 工作及新書《NLP with Transformers》。他介紹 Transformers library 可將 PyTorch 模型匯出為 ONNX 格式,讓工程師進一步降低延遲、提高吞吐量。
Hugging Face 提供端到端教程,示範如何以 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分類推理。
Hugging Face 與 Graphcore 合作,讓開發者可在 Graphcore IPU 上以生產規模部署最佳化 Transformers。開源工具庫 Optimum 將提供經 Hugging Face 認證的硬件最佳化模型,首批 IPU 最佳化模型將於今年稍後登上 Optimum。
Hugging Face 推出適用於 Amazon SageMaker 的 Inference DLC 和 Inference Toolkit,支援部署已訓練模型及 Model Hub 上 10,000+ 個公開模型。
推薦理由:文章分別示範訓練完成後、從 Amazon S3 檢查點及從 Model Hub 部署模型,並附上建立 SageMaker 推理端點的程式範例。
Hugging Face 首篇系列文章以 BERT 為例,測試並分析 CPU 核心配置、NUMA 親和性與多模型實例如何影響推理延遲及吞吐量。結果顯示,小型及中型問題使用單一 socket 通常延遲較佳,大型問題則可利用雙 socket;多實例方案的吞吐量接近線性擴展。文中舉例,8 核實例為 0.808$/h,48 核機器則為 4.848$/h,前者成本降低 6x。
Hugging Face 推出 Accelerate,PyTorch 訓練腳本加入五行程式碼後,即可支援不同分散式設定及混合精度訓練。Accelerate 提供統一 API,準備模型、最佳化器及 DataLoader,並處理裝置配置和反向傳播。
推薦理由:Accelerate 將 PyTorch 分散式訓練及混合精度所需樣板封裝成少量 API 改動,並提供統一啟動器,呈現減少訓練腳本跨環境改動的實作方式。
Hugging Face 與 Amazon 宣佈戰略合作,推出 Hugging Face Deep Learning Containers,讓用户可在 Amazon SageMaker 訓練 Hugging Face Transformer 模型。
推薦理由:文章展示 Hugging Face 模型在 SageMaker 的訓練接入方式,並稱 SDK 擴展可把實驗設定與執行所需時間由數天縮至數分鐘。
Hugging Face 介紹以 PyTorch / XLA 在 Cloud TPU 訓練 Transformers 的整合方式,並保留 Hugging Face Trainer 原有介面。
推薦理由:文章梳理 PyTorch / XLA 接入 Hugging Face Trainer 的設備選擇、梯度同步與輸入流水線,並説明固定張量形狀對減少編譯成本的作用。
Hugging Face 團隊提升了 Transformers 中 BERT、RoBERTa、ELECTRA 和 MPNet 的 TensorFlow 模型運算速度。
OpenAI 將 Kubernetes 叢集擴展至 7,500 個節點,為大型模型及快速小規模迭代研究提供可擴展基礎設施。支援的模型包括 GPT-3、CLIP 和 DALL·E,研究例子則有《Scaling Laws for Neural Language Models》。
OpenAI 宣佈將其深度學習框架統一採用 PyTorch。
推薦理由:這項公告提供 OpenAI 深度學習框架選擇的背景,並明確指出其組織方向是統一採用 PyTorch。
Microsoft 向 OpenAI 投資 $1 billion,並合作在 Microsoft Azure 建設可擴展至 AGI 的硬件與軟件平台。雙方將共同開發新的 Azure AI 超級計算技術,Microsoft 亦會成為 OpenAI 的獨家雲端供應商。雙方還將共同進一步擴展 Microsoft Azure 支援大規模 AI 系統的能力。
推薦理由:這項合作涵蓋投資、Azure AI 超級計算技術開發與獨家雲端供應,呈現 OpenAI 建設 AGI 平台所涉及的資金、技術與雲端合作安排。
OpenAI 正與 Microsoft 合作,開始在 Azure 上運行大部分大規模實驗。
OpenAI 指出,深度學習是一門實證科學,團隊基礎設施的質素會放大進展。現有開源生態令任何人都能建立優良的深度學習基礎設施。