跳到正文
6月20日週四
6月12日週三
  1. Hugging Face Blog63

    Hugging Face 在 TRL 推出 RLOO Trainer,作為 PPO 的線上 RLHF 替代方案

    Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。

    推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。

6月5日週三
  1. Mistral AI67

    Mistral AI 推出模型客製化方案,提供三種微調入口

    Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。

    推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。

5月28日週二
  1. Hugging Face Blog66

    使用 Sentence Transformers 訓練及微調嵌入模型

    Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。

    推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。

5月7日週二
  1. OpenAI News27

    OpenAI 對數據與 AI 的方針

    OpenAI 説明其對數據與 AI 的方針,並介紹一款面向創作者及內容所有者的全新 Media Manager。ChatGPT 推出一年多後,AI 正改變人們的生活、工作與學習方式,亦引發關於 AI 時代數據的重要討論;OpenAI 並談及未來方向。

4月4日週四
3月20日週三
3月4日週一
2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。

2月23日週五
11月9日週四
11月7日週二
  1. Hugging Face Blog49

    推出 Prodigy-HF:與 Hugging Face 直接整合

    Explosion 推出 Prodigy-HF,將 Prodigy 與 Hugging Face 生態系直接整合,支援以標註資料訓練及重用 Hugging Face 模型。插件可透過命令列微調命名實體識別及文本分類模型,並將訓練模型儲存至磁碟後上載至 Hugging Face Hub。使用者亦可把已標註資料集發佈至 Hugging Face Hub,供社羣共享。

10月25日週三
8月22日週二
6月12日週一
  1. Hugging Face Blog60

    Hugging Face 比較 GPT-4 與人工評審,研究基礎模型能否像人類一樣標註資料

    Hugging Face 用 327 個提示詞,比較 GPT-4 與人工評審對 4 款開源指令微調模型回答的偏好評分,結果顯示 GPT-4 評分存在位置偏差。GPT-4 也傾向偏好以 InstructGPT、GPT-4 或 ChatGPT 生成資料訓練的模型;它與人工評分在非編碼任務上的相關性為 0.5,在編碼任務上較低但仍為正值。

    推薦理由:研究以偏好比較呈現人工與 GPT-4 評分差異,並拆解位置偏差及任務類型的相關性,提供檢視自動評審可靠度的具體依據。

6月7日週三
  1. Hugging Face Blog63

    Hugging Face Hub 新增 DuckDB 整合,可分析逾 50,000 個資料集

    Hugging Face Hub 新增 DuckDB 整合,讓使用者可用 SQL 分析 Hub 上逾 50,000 個資料集。Dataset Viewer 會將 Hub 上所有公開資料集自動轉為 Parquet,檔案 URL 可透過 `/parquet` endpoint 取得。

    推薦理由:這項整合把 Hub 公開資料集自動轉為 Parquet,並讓 DuckDB 對遠端檔案執行 SQL,提供直接探索資料集內容的操作路徑。

4月12日週三
  1. Hugging Face Blog51

    Substra 如何用聯邦學習構建保護私隱的 AI

    Hugging Face 與 Substra 合作製作互動空間,介紹聯邦學習如何在數據不離開本地的情況下協同訓練模型。Substra 是面向真實生產環境的開源聯邦學習框架,模型權重在多個伺服器間傳遞,讓研究者利用不同來源的數據訓練模型。空間可調整樣本分佈並觀察簡單模型的反應;文中稱,聯邦學習模型在驗證數據上的表現幾乎總是優於單一來源訓練的模型。

4月5日週三
  1. Hugging Face Blog78

    StackLLaMA:以 RLHF 訓練 LLaMA 的實作指南

    Hugging Face 發佈 StackLLaMA,這是一個以 LLaMA 7B 為基礎、經 RLHF 微調、用於回答 Stack Exchange 問題的模型;完整訓練流程納入 Hugging Face TRL library。文章逐步示範監督式微調、獎勵模型訓練及 PPO 強化學習,並介紹 Stack Exchange 數據的偏好評分與 LoRA 等記憶體效率方法。

    推薦理由:文章串聯 SFT、偏好獎勵模型與 PPO 三階段,並示範以 8-bit 載入和 LoRA 降低 RLHF 微調的記憶體需求,呈現可復用的訓練流程。

3月27日週一
  1. Hugging Face Blog51

    使用 Hugging Face 與 Flower 進行聯邦學習

    這篇教程示範如何結合 Hugging Face 與 Flower,在多個客户端聯邦微調預訓練的 distilBERT,將 IMDB 評分分類為正面或負面。客户端在本地訓練模型並將參數傳回伺服器,由 FedAvg 聚合參數,無需共享數據。另有使用 Flower 的 simulation 功能在 Google Colab 模擬聯邦環境的 Notebook。

3月9日週四
  1. Hugging Face Blog75

    在 24GB 消費級 GPU 上使用 RLHF 微調 20B 大語言模型

    Hugging Face 發佈 trl 與 peft 整合,介紹以 RLHF 在 24GB 消費級 GPU 上微調 20B 大語言模型的方法。示例以 gpt-neox-20b 為基礎,結合 8-bit 載入與 PEFT 低秩適配器,並透過停用適配器讓同一模型提供參考與當前 logits。

    推薦理由:文章拆解 8-bit 載入、PEFT 低秩適配器與共用參考模型的組合,呈現降低 RLHF 微調大型模型顯存需求的實作思路。

2月10日週五
  1. Hugging Face Blog72

    使用 🤗 PEFT 進行參數高效微調

    Hugging Face 推出 🤗 PEFT 函式庫,整合 🤗 Transformers 與 🤗 Accelerate,支援以參數高效微調大型語言模型。該方法凍結預訓練模型的大部分參數,只訓練少量參數並保存增量權重,以降低計算和儲存成本,同時達到與完整微調相若的效能。文中 LoRA 範例為 bigscience/T0_3B 保存的 adapter_model.bin 僅 19MB。

    推薦理由:文章以 LoRA 範例展示 🤗 PEFT 如何接入 🤗 Transformers 的微調流程,並説明只保存增量權重可減少儲存負擔,另交代訓練參數設定與權重載入方式。

1月24日週二
  1. Hugging Face Blog60

    甚麼令對話智能體有用?

    Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。

    推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。

1月3日週二
  1. Hugging Face Blog48

    圖機器學習入門

    Hugging Face Blog 概述圖機器學習基礎,涵蓋圖的結構、應用任務、表示方式與圖上學習方法。內容説明節點、邊及同質/異質、有向/無向圖等概念,並介紹圖層級、節點、邊與子圖任務,以及邊集合和鄰接矩陣等表示方式。文章亦簡述前神經網絡方法、Graph Neural Networks 和用於圖的 Transformers。

12月15日週四
  1. Hugging Face Blog63

    Hugging Face 倫理與社會電子報第 2 期:談談機器學習中的偏見

    Hugging Face 的 Ethics and Society 團隊在第 2 期電子報中,探討機器學習偏見如何隨部署情境轉化為風險,並整理團隊用於不同開發階段的工具與建議。

    推薦理由:文章把機器偏見連結至具體部署情境,並按任務定義、資料整理與模型開發階段整理評估及記錄做法,讓風險辨識不只停留在模型輸出檢查。

12月9日週五
  1. Hugging Face Blog68

    RLHF 圖解:人類反饋強化學習的訓練流程

    Hugging Face Blog 梳理 RLHF 的三階段訓練流程,包括預訓練語言模型、收集偏好數據並訓練獎勵模型,以及以強化學習微調模型。人類標註者透過比較並排序同一提示下生成的文本來建立偏好數據;PPO 微調時,KL 懲罰用於限制策略偏離初始模型。

    推薦理由:文章拆解 RLHF 的三階段訓練流程,並説明偏好排序如何訓練獎勵模型,以及 KL 懲罰如何約束後續策略更新。

12月2日週五
  1. Hugging Face Blog62

    蛋白質深度學習入門:遷移學習與摺疊預測

    Hugging Face Blog 説明如何將語言模型的遷移學習應用於蛋白質序列,先以大量蛋白質序列預訓練,再遷移至摺疊和分類等任務。文章指出,ESMFold 類似 AlphaFold2,但執行時毋須外部資料庫或搜尋步驟。文中亦提供 PyTorch 和 TensorFlow 的蛋白質模型微調範例,以及目前僅支援 PyTorch 的 ESMFold 筆記本。

    推薦理由:文章以語言模型遷移學習作類比,説明蛋白質序列預訓練如何延伸至摺疊及分類任務,並提供微調筆記本作實作起點。

11月3日週四
9月28日週三
  1. Hugging Face Blog59

    Hugging Face AutoTrain 新增圖像分類任務

    Hugging Face 為 AutoTrain 新增圖像分類任務,擴展其 Computer Vision 支援,讓用户可透過免配置流程訓練圖像分類模型。AutoTrain 可載入本地資料或 Hugging Face Hub 上的資料集,並嘗試多個模型候選;文中的蝴蝶分類例子中,最佳模型準確率為 84%。使用 5 個候選模型及少於 500 張圖片訓練免費。

9月26日週一
  1. Hugging Face Blog70

    Hugging Face 介紹 SetFit:無需提示詞的高效少樣本學習框架

    Hugging Face 與 Intel Labs、UKP Lab 共同介紹 SetFit,這是一套無需提示詞、以少量標註資料微調 Sentence Transformers 的少樣本學習框架。

    推薦理由:文章比較 SetFit 與其他少樣本方法在 RAFT 等基準的表現,並列出訓練時間與成本,提供分類效能和訓練效率的直接參照。

9月7日週三
  1. Hugging Face Blog57

    如何使用 Megatron-LM 訓練語言模型

    Megatron-LM 可在 NVIDIA GPU 上用於訓練 GPT2,並可將訓練後的模型轉換為 Transformers 支援的格式。教程以 110M 參數的 CodeParrot 為例,涵蓋資料預處理、8 張 GPU 訓練(約需 12 小時)及權重轉換。文章指出額外的預處理和轉換會增加時間開銷,建議將 Megatron-LM 用於預訓練或較長時間微調,而非中型模型的短期微調。

7月16日週六
  1. Hugging Face Blog46

    MNIST 模型如何利用動態對抗資料訓練

    Hugging Face 的教學以 MNIST 手寫數字識別示範,如何動態收集人類生成的對抗樣本並用於模型訓練。示範模型訓練 20 epochs 後,在測試集準確率為 89%;用户可在 Spaces 畫布書寫 0-9,並標記能騙過模型的樣本。樣本累積至門檻後會用來再訓練模型,並重複多輪,以提高模型穩健性。

6月23日週四
  1. OpenAI News64

    OpenAI 以 Video PreTraining 訓練神經網絡玩 Minecraft

    OpenAI 透過 Video PreTraining(VPT),使用大量未標註的人類 Minecraft 遊玩影片,配合少量已標註的承包商數據訓練神經網絡玩 Minecraft。經微調後,模型可學會製作鑽石工具;熟練玩家完成這項任務通常需要超過 20 分鐘(24,000 次操作)。模型使用按鍵輸入和滑鼠移動這種原生人類操作介面,研究將其視為邁向通用電腦操作智能體的一步。

    推薦理由:這項研究展示如何利用大量未標註的人類遊玩影片,配合少量標註數據訓練可透過鍵盤和滑鼠操作遊戲的模型。

5月17日週二
  1. Hugging Face Blog42

    機器學習專家:Sasha Luccioni

    Hugging Face 研究科學家 Sasha Luccioni 在訪談中談及她對機器學習模型與數據集的倫理、社會影響及環境足跡研究。她擔任 Big Science Workshop 碳足跡工作組共同主席,探討電子郵件排放與製造成本等環境影響,並參與數據整理和多語言工作,避免語料過度偏重英語。

4月22日週五
2月11日週五
11月29日週一
  1. Hugging Face Blog50

    Hugging Face 推出 Data Measurements Tool,供互動檢視資料集

    Hugging Face 推出開源 Data Measurements Tool,提供 Python 程式庫及免程式碼介面,供使用者探索、測量和比較 NLP 資料集。工具可呈現缺失值、詞彙與標籤分佈、重複項及嵌入聚類,並以詞對 nPMI 協助檢視資料中的刻板印象。alpha 版本(v0)目前以數個常見英文資料集示範功能,包括 SQuAD、imdb 和 C4。

6月10日週四
2月9日週二
9月4日週五