HuggingFace Daily Papers(社區熱門論文)·· 1 天前AI 評分67
基礎模型可藉訓練數據中的線索進行推理
Base Models Can Reason By Taking a Cue From Training Data
AI 導讀
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
來源:HuggingFace Daily Papers(社區熱門論文) · huggingface.co