跳到正文
原文
Hugging Face Blog·· 2024-03-20精選AI 評分71

Cosmopedia 如何構建用於大語言模型預訓練的大規模合成數據

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 導讀

Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。

推薦理由

文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。

來源:Hugging Face Blog · huggingface.co