跳到正文
目前篩選:教學
  1. Hugging Face Blog61

    Granite 4.1 LLM 如何構建:預訓練、微調與強化學習流程

    Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。

    推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。

  1. Hugging Face Blog65

    Transformers v5 重設分詞器架構,提升透明度與模組化

    Transformers v5 將分詞器架構與訓練所得的詞彙、合併規則分離,並在類別中明確呈現正規化器等組件。相較 v4 每個模型各有 slow/fast 兩套實作,v5 改為每個模型一個檔案,預設採用 Rust-based TokenizersBackend;分詞器類別亦可直接實例化並用自有語料訓練。

    推薦理由:文章對照 v4 與 v5,説明分離分詞器架構和訓練詞彙後,如何更直接檢查組件,並沿用模型架構訓練自訂分詞器。

  1. Hugging Face Blog72

    Hugging Face Skills 讓 Claude Code 微調開源大語言模型

    Hugging Face Skills 讓 Claude Code 等編碼智能體透過對話處理模型微調,涵蓋資料集驗證、GPU 選擇、雲端工作提交與進度監控。它亦兼容 Codex 和 Gemini CLI;文中以 Qwen3-0.6B 在 open-r1/codeforces-cots 上進行 SFT 為例,估算使用 t4-small 約需 20 分鐘、成本約 $0.30。

    推薦理由:文章將資料集驗證、GPU 選擇、雲端工作提交與進度監控串成智能體訓練流程,並比較 SFT、DPO、GRPO 的適用場景。

  1. Hugging Face Blog60

    Hugging Face + Dask 如何擴展 AI 資料處理

    Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。

    推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。

  1. Hugging Face Blog66

    使用 Sentence Transformers 訓練及微調嵌入模型

    Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。

    推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。

  1. Hugging Face Blog61

    Matryoshka Embedding 模型入門:訓練、使用與效能比較

    Hugging Face Blog 介紹 Matryoshka Embedding 模型的訓練與使用方法,並比較向量截短後與一般嵌入模型的表現。

    推薦理由:文章把 Sentence Transformers 訓練方式與 STSBenchmark 實測相連,量化向量縮至原大小 8.3% 後仍保留 98.37% 表現。

  1. Hugging Face Blog78

    StackLLaMA:以 RLHF 訓練 LLaMA 的實作指南

    Hugging Face 發佈 StackLLaMA,這是一個以 LLaMA 7B 為基礎、經 RLHF 微調、用於回答 Stack Exchange 問題的模型;完整訓練流程納入 Hugging Face TRL library。文章逐步示範監督式微調、獎勵模型訓練及 PPO 強化學習,並介紹 Stack Exchange 數據的偏好評分與 LoRA 等記憶體效率方法。

    推薦理由:文章串聯 SFT、偏好獎勵模型與 PPO 三階段,並示範以 8-bit 載入和 LoRA 降低 RLHF 微調的記憶體需求,呈現可復用的訓練流程。

  1. Hugging Face Blog60

    甚麼令對話智能體有用?

    Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。

    推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。

  1. Hugging Face Blog63

    Hugging Face 倫理與社會電子報第 2 期:談談機器學習中的偏見

    Hugging Face 的 Ethics and Society 團隊在第 2 期電子報中,探討機器學習偏見如何隨部署情境轉化為風險,並整理團隊用於不同開發階段的工具與建議。

    推薦理由:文章把機器偏見連結至具體部署情境,並按任務定義、資料整理與模型開發階段整理評估及記錄做法,讓風險辨識不只停留在模型輸出檢查。

  1. Hugging Face Blog68

    RLHF 圖解:人類反饋強化學習的訓練流程

    Hugging Face Blog 梳理 RLHF 的三階段訓練流程,包括預訓練語言模型、收集偏好數據並訓練獎勵模型,以及以強化學習微調模型。人類標註者透過比較並排序同一提示下生成的文本來建立偏好數據;PPO 微調時,KL 懲罰用於限制策略偏離初始模型。

    推薦理由:文章拆解 RLHF 的三階段訓練流程,並説明偏好排序如何訓練獎勵模型,以及 KL 懲罰如何約束後續策略更新。

  1. Hugging Face Blog62

    蛋白質深度學習入門:遷移學習與摺疊預測

    Hugging Face Blog 説明如何將語言模型的遷移學習應用於蛋白質序列,先以大量蛋白質序列預訓練,再遷移至摺疊和分類等任務。文章指出,ESMFold 類似 AlphaFold2,但執行時毋須外部資料庫或搜尋步驟。文中亦提供 PyTorch 和 TensorFlow 的蛋白質模型微調範例,以及目前僅支援 PyTorch 的 ESMFold 筆記本。

    推薦理由:文章以語言模型遷移學習作類比,説明蛋白質序列預訓練如何延伸至摺疊及分類任務,並提供微調筆記本作實作起點。

  1. Hugging Face Blog73

    使用 🤗 Transformers 微調 Whisper 以支援多語言 ASR

    Hugging Face Blog 提供使用 🤗 Transformers 為多語言 ASR 資料集微調 Whisper 的逐步指南,涵蓋資料準備、訓練與評估。

    推薦理由:文章將 Whisper 多語言微調拆解為資料準備、特徵處理、訓練評估與示範流程,並以印地語資料展示從預處理到模型分享的可複用實作路徑。

  1. Hugging Face Blog62

    使用 🤗 Transformers 微調 ViT 進行圖像分類

    這篇教程示範使用 🤗 Datasets 與 🤗 Transformers,將預訓練模型 google/vit-base-patch16-224-in21k 微調為豆類葉片圖像分類器。

    推薦理由:文章以 beans 葉片分類串起資料載入、ViT 圖像預處理、Trainer 微調與評估,並展示資料即時轉換及訓練參數設定。

  1. Hugging Face Blog60

    Hugging Face 講解如何用 PyTorch / XLA 在 Cloud TPU 訓練 Transformers 模型

    Hugging Face 介紹以 PyTorch / XLA 在 Cloud TPU 訓練 Transformers 的整合方式,並保留 Hugging Face Trainer 原有介面。

    推薦理由:文章梳理 PyTorch / XLA 接入 Hugging Face Trainer 的設備選擇、梯度同步與輸入流水線,並説明固定張量形狀對減少編譯成本的作用。

已經到底了