参考资源
https://zhuanlan.zhihu.com/p/14988009150
https://www.cnblogs.com/fariver/p/18697000
简介
DeepSeek团队2024年12月末发布了V3版本,个人认为开源模型的标杆基本就看Llama、Qwen、DeepSeek这几家了,小模型可以加上Gemma和Phi。
主要思路:
- 降低训练成本:通过FP8低精度训练、DualPipe双向流水线等
- 降低推理成本:优化MoE负载均衡等
- 优化训练数据:使用 14.8T 高质量、多样化的 token,增加了数学和编程样本的比例,扩大了多语言覆盖范围
- 进一步提升效果:多 Token 预测(MTP)、从 DeepSeek-R1 中蒸馏推理能力等
效果:
- 在 MMLU、MMLU-Pro、GPQA 等知识性基准测试中,性能与 GPT-4o、Claude-3.5-Sonnet 等领先闭源模型相当。
- 在 代码和数学 基准测试中,取得了最先进的性能,甚至超越了 GPT-4o。
- 在 AlpacaEval 2.0 和 Arena-Hard 的开放式评估中表现出色。
训练成本 :
- 总成本 :278.8 万 H800 GPU 小时,约 557.6 万美元。
- 预训练效率 :每训练 1 万亿个 token 仅需 18 万 H800 GPU 小时,训练过程稳定,无需回滚。
开源