跳到正文

數據與訓練

訓練側的門道:數據集構建、合成數據、預訓練與後訓練方法、算力與訓練成本。

最新精選

第 1–20 條 · 共 55 條
10月2日週五
  1. Google Research64

    Google Research 介紹採用 TEE 的新一代聯邦學習系統

    Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。

    推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。

9月29日週二
  1. Hugging Face Blog65

    NVIDIA Kumo Tabular 為表格預測樹立準確率與效率的新前沿

    NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。

    推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。

6月5日週五
  1. Hugging Face Blog62

    NVIDIA 發佈 Nemotron 3.5 Content Safety,整合多模態安全判定與自訂政策

    NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。

    推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。

5月19日週二
  1. Hugging Face Blog66

    Hugging Face 發佈 Ettin Reranker 系列六款模型,規模涵蓋 17.6M 至 1.00B

    Hugging Face 發佈六款基於 Ettin ModernBERT encoder 的 Sentence Transformers CrossEncoder reranker,參數規模由 17.6M 至 1.00B,並公開訓練數據及完整訓練方案。

    推薦理由:文章以 MTEB(eng, v2) Retrieval、NanoBEIR 及多種硬件吞吐測試比較六種尺寸,呈現 Ettin Reranker 在排序品質與速度間的取捨。

4月29日週三
  1. Hugging Face Blog61

    Granite 4.1 LLM 如何構建:預訓練、微調與強化學習流程

    Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。

    推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。

3月31日週二
  1. Hugging Face Blog65

    Hugging Face 發佈 TRL v1.0,打造能隨後訓練領域演進的函式庫

    Hugging Face 發佈 TRL v1.0,將已實作超過 75 種後訓練方法的研究程式碼庫明確定位為具穩定性契約的函式庫。穩定核心遵循語義化版本,實驗層則可快速變動;從最後一個 0.x 版本升級只需少量遷移。

    推薦理由:TRL v1.0 把遵循語義化版本的穩定核心與可快速變動的實驗層置於同一套函式庫,呈現下游穩定需求與新方法迭代之間的契約設計。

3月12日週四
  1. Google Research73

    Google Research 推出 Groundsource,以 Gemini 將新聞報道轉化為突發洪水資料

    Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。

    推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。

3月10日週二
  1. Hugging Face Blog70

    Hugging Face Hub 推出 Storage Buckets,提供可變的 S3 類物件儲存

    Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。

    推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。

3月9日週一
  1. Hugging Face Blog68

    LeRobot 發佈 v0.5.0,擴展機械人硬件、策略模型及資料與模擬功能

    LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。

    推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。

1月13日週二
12月18日週四
  1. Hugging Face Blog65

    Transformers v5 重設分詞器架構,提升透明度與模組化

    Transformers v5 將分詞器架構與訓練所得的詞彙、合併規則分離,並在類別中明確呈現正規化器等組件。相較 v4 每個模型各有 slow/fast 兩套實作,v5 改為每個模型一個檔案,預設採用 Rust-based TokenizersBackend;分詞器類別亦可直接實例化並用自有語料訓練。

    推薦理由:文章對照 v4 與 v5,説明分離分詞器架構和訓練詞彙後,如何更直接檢查組件,並沿用模型架構訓練自訂分詞器。

12月4日週四
  1. Hugging Face Blog72

    Hugging Face Skills 讓 Claude Code 微調開源大語言模型

    Hugging Face Skills 讓 Claude Code 等編碼智能體透過對話處理模型微調,涵蓋資料集驗證、GPU 選擇、雲端工作提交與進度監控。它亦兼容 Codex 和 Gemini CLI;文中以 Qwen3-0.6B 在 open-r1/codeforces-cots 上進行 SFT 為例,估算使用 t4-small 約需 20 分鐘、成本約 $0.30。

    推薦理由:文章將資料集驗證、GPU 選擇、雲端工作提交與進度監控串成智能體訓練流程,並比較 SFT、DPO、GRPO 的適用場景。

10月27日週一
  1. Hugging Face Blog67

    Hugging Face 改進 datasets 與 huggingface_hub 串流功能,啟動請求最多減少 100 倍

    Hugging Face 改進 datasets 與 huggingface_hub 的資料集串流,資料檔解析快 10 倍、啟動請求最多減少 100 倍,串流速度最高提升至原來的 2 倍。

    推薦理由:文章拆解跨 DataLoader workers 快取與 Parquet 預取如何改善資料解析和吞吐,並列出 256 workers 下的請求量及穩定性結果,呈現大規模串流訓練的優化方向。

10月24日週五
  1. Hugging Face Blog75

    LeRobot v0.4.0 升級開源機械人學習工具鏈

    LeRobot 發佈 v0.4.0,加入 Datasets v3.0、VLA 模型 PI0 和 PI0.5、GR00T N1.5,以及硬件插件系統。Datasets v3.0 採用分塊 episode 格式並支援串流,可處理 OXE 級(> 400GB)資料集。

    推薦理由:資料集規模化、模擬評測、多 GPU 訓練和硬件插件同時更新,勾勒出 LeRobot 從資料處理到機械人控制的工具鏈演進。

10月14日週二
  1. Hugging Face Blog63

    NVIDIA 發佈 Nemotron-Personas-India 印度合成人物設定數據集

    NVIDIA 發佈 Nemotron-Personas-India,一套依印度人口、地理及文化分佈合成的人物設定數據集,採用 CC BY 4.0 授權。數據集包含 21 million 個人物設定(3M 條記錄、每條 7 個設定),支援英語及以天城文、拉丁字母書寫的印地語,並有 27 個欄位和 7.7 billion tokens。

    推薦理由:數據集以印度人口、地域分佈為基礎,涵蓋英語及兩種文字形式的印地語,並採 CC BY 4.0 授權,呈現其作為區域模型訓練素材的語言覆蓋與使用條件。

9月11日週四
  1. Hugging Face Blog67

    Together AI 支援微調 Hugging Face Hub 上的兼容 LLM

    Together AI 宣佈可透過其平台微調 Hugging Face Hub 上兼容的 LLM,微調後模型可供推理、下載或推回 Hub。流程以 Together 官方目錄中的基礎模型提供訓練配置,自選的 Hugging Face 模型則是實際微調對象;文中稱一般預期支援 100B params 以下的 CausalLM 模型。

    推薦理由:文章交代了基礎模型提供訓練配置、自選 Hub 模型作為微調對象的分工,並列出讀取私有模型與將訓練結果推回 Hub 的接入流程。

9月9日週二
9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

8月8日週五
  1. Hugging Face Blog67

    Hugging Face 推出開源 AI Sheets,供用户無代碼建立、豐富及轉換資料集

    Hugging Face 推出開源無代碼工具 AI Sheets,讓用户使用 AI 模型建立、豐富及轉換資料集。它以試算表介面新增提示詞欄位,支援透過 Inference Providers 使用 Hugging Face Hub 上數以千計的開放模型,也可使用本地模型,並可本機部署或部署至 Hub。

    推薦理由:AI Sheets 將提示詞生成、人工校訂與資料集匯出串成工作流,校訂及按讚的儲存格可作為 few-shot 範例供後續生成重用。

7月16日週三
  1. Hugging Face Blog68

    Ettin Suite 發佈 17M-1B 參數的配對編碼器與解碼器模型

    Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。

    推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。