Dwarkesh Patel:Podcast & Blog· Dwarkesh Patel·· 28 天前AI 評分59
小規模實驗顯示數據改進帶來的預訓練計算效率提升高於模型改進
Pretraining progress is mostly coming from data
AI 導讀
Dwarkesh Patel 的研究以小規模預訓練比較 2019 至 2025 年的模型配方與數據集改進,發現數據帶來的計算效率提升較大。在 1e19 FLOPs 下,數據與模型改進的計算效率提升分別為 12.0x 和 3.7x。在 3.16e18 FLOPs 的 OLMES 測試中,模型與數據改進的各自效應合計可解釋 88% 的分數變異。
來源:Dwarkesh Patel:Podcast & Blog · dwarkesh.com