跳到正文

數據與訓練

訓練側的門道:數據集構建、合成數據、預訓練與後訓練方法、算力與訓練成本。

最新精選

第 21–40 條 · 共 55 條
5月21日週三
12月16日週一
  1. Hugging Face Blog61

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言建立數據集

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。

    推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。

10月24日週四
10月9日週三
  1. Hugging Face Blog60

    Hugging Face + Dask 如何擴展 AI 資料處理

    Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。

    推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。

10月1日週二
9月17日週二
  1. Hugging Face Blog69

    Hugging Face 為 Datasets 推出 SQL Console

    Hugging Face 在 Hub 的資料集頁面推出 SQL Console,讓用户直接在瀏覽器以 SQL 查詢和篩選資料集。它由 DuckDB WASM 驅動,不需伺服器或後端;非 Parquet 格式的資料集會自動轉換前 5GB,查詢結果可匯出為 Parquet,公開資料集的結果亦可透過連結分享。

    推薦理由:SQL Console 以 DuckDB WASM 在瀏覽器查詢資料集,並示範用 SQL 將 Alpaca 格式轉為對話格式,提供一個可參照的資料整理流程。

8月20日週二
8月7日週三
7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

6月12日週三
  1. Hugging Face Blog63

    Hugging Face 在 TRL 推出 RLOO Trainer,作為 PPO 的線上 RLHF 替代方案

    Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。

    推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。

6月5日週三
  1. Mistral AI67

    Mistral AI 推出模型客製化方案,提供三種微調入口

    Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。

    推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。

5月28日週二
  1. Hugging Face Blog66

    使用 Sentence Transformers 訓練及微調嵌入模型

    Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。

    推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。

3月20日週三
2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。

2月23日週五
8月22日週二
6月12日週一
  1. Hugging Face Blog60

    Hugging Face 比較 GPT-4 與人工評審,研究基礎模型能否像人類一樣標註資料

    Hugging Face 用 327 個提示詞,比較 GPT-4 與人工評審對 4 款開源指令微調模型回答的偏好評分,結果顯示 GPT-4 評分存在位置偏差。GPT-4 也傾向偏好以 InstructGPT、GPT-4 或 ChatGPT 生成資料訓練的模型;它與人工評分在非編碼任務上的相關性為 0.5,在編碼任務上較低但仍為正值。

    推薦理由:研究以偏好比較呈現人工與 GPT-4 評分差異,並拆解位置偏差及任務類型的相關性,提供檢視自動評審可靠度的具體依據。

6月7日週三
  1. Hugging Face Blog63

    Hugging Face Hub 新增 DuckDB 整合,可分析逾 50,000 個資料集

    Hugging Face Hub 新增 DuckDB 整合,讓使用者可用 SQL 分析 Hub 上逾 50,000 個資料集。Dataset Viewer 會將 Hub 上所有公開資料集自動轉為 Parquet,檔案 URL 可透過 `/parquet` endpoint 取得。

    推薦理由:這項整合把 Hub 公開資料集自動轉為 Parquet,並讓 DuckDB 對遠端檔案執行 SQL,提供直接探索資料集內容的操作路徑。

4月5日週三
  1. Hugging Face Blog78

    StackLLaMA:以 RLHF 訓練 LLaMA 的實作指南

    Hugging Face 發佈 StackLLaMA,這是一個以 LLaMA 7B 為基礎、經 RLHF 微調、用於回答 Stack Exchange 問題的模型;完整訓練流程納入 Hugging Face TRL library。文章逐步示範監督式微調、獎勵模型訓練及 PPO 強化學習,並介紹 Stack Exchange 數據的偏好評分與 LoRA 等記憶體效率方法。

    推薦理由:文章串聯 SFT、偏好獎勵模型與 PPO 三階段,並示範以 8-bit 載入和 LoRA 降低 RLHF 微調的記憶體需求,呈現可復用的訓練流程。

3月9日週四
  1. Hugging Face Blog75

    在 24GB 消費級 GPU 上使用 RLHF 微調 20B 大語言模型

    Hugging Face 發佈 trl 與 peft 整合,介紹以 RLHF 在 24GB 消費級 GPU 上微調 20B 大語言模型的方法。示例以 gpt-neox-20b 為基礎,結合 8-bit 載入與 PEFT 低秩適配器,並透過停用適配器讓同一模型提供參考與當前 logits。

    推薦理由:文章拆解 8-bit 載入、PEFT 低秩適配器與共用參考模型的組合,呈現降低 RLHF 微調大型模型顯存需求的實作思路。