Hugging Face Blog·· 2024-03-20精選AI 評分71
Cosmopedia 如何構建用於大語言模型預訓練的大規模合成數據
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
AI 導讀
Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。
推薦理由
文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。
來源:Hugging Face Blog · huggingface.co