DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0628
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0628,並稱模型的推理能力有所提升。HumanEval Pass@1 由 79.88% 升至 84.76%,MATH ACC@1 由 55.02% 升至 71.02%,BBH 由 78.56% 升至 83.40%。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0628,並稱模型的推理能力有所提升。HumanEval Pass@1 由 79.88% 升至 84.76%,MATH ACC@1 由 55.02% 升至 71.02%,BBH 由 78.56% 升至 83.40%。
DeepSeek 將 deepseek-coder 升級至 DeepSeek-Coder-V2-0614,編碼能力顯著提升。其程式碼生成、理解、除錯及補全能力達到 GPT-4-Turbo-0409 水平,數學與推理能力出色,通用能力則與 DeepSeek-V2-0517 相當。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 準確率由 63.9% 升至 77.6%。
Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。
推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。