Baseten Base Labs:模型研究·· 6 小時前AI 評分50
Qwen3 蒸餾何時有助於強化學習?Baseten Base Labs 比較四種模型規模
02When does distillation help reinforcement learning?Checkpoint·SEP 2026
AI 導讀
Baseten Base Labs 比較 Qwen3 不同規模先蒸餾再接受 GRPO 的效果,發現蒸餾在強化學習後的收益因模型大小和任務而異。經 80M RL response tokens 後,SFT + RL 在 0.6B、1.7B 和 4B 分別領先 11.3%、13.1% 和 2.1%,而 8B 則由 RL only 領先 6.4%。
來源:Baseten Base Labs:模型研究 · labs.baseten.co