跳到正文
原文
Hugging Face Blog·· 2026-04-29精選AI 評分61

Granite 4.1 LLM 如何構建:預訓練、微調與強化學習流程

Granite 4.1 LLMs: How They’re Built

AI 導讀

Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。

推薦理由

文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。

來源:Hugging Face Blog · huggingface.co