| 模型 | 论文发布时间 | 模型参数 | 训练数据 | 训练算力成本 | 模型架构特点 |
|---|---|---|---|---|---|
| V1 | 24/1/5 | 67B | 2万亿token中英数据 | 未公布,参考v2论文提到H800用时,通过推测预训练花费120万美元(基于租赁H800每小时2美元) | Llama架构更大的神经网络深度多步学习率调度器 |
| V2 | 24/5/7 | 236B(激活21B) | 8.1万亿token多语言数据 | 文中没明确给出,根据文中提到的H800 GPU小时推测预训练花费276万美元 | MOE架构160个路由专家及2个共享专家。多头潜在注意力(MLA)机制 |
| V3 | 24/12/27 | 671B(激活37B) | 14.8万亿token多语言数据 | 论文指出单次训练成本557.6万美元 | MOE架构 |
256 个路由专家及 1 个共享专家。1.FP8混合精度训练2.无辅助损失的负载均衡策略3.多 token 预测机制4.MLA | | R1 | 25/1/22 | 671B(激活37B) | 预训练:4.8万亿 token。数千条高质量的长链推理数据 | 256未公布,不过其基于V3上面做RL,算力成本不会太高 | MOE架构
1.基于 DeepSeek V3 基座模型2.结合冷启动数据的强化学习 |
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
发表时间: 2024年1月5日
论文地址:[2401.02954] DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
**V1模型:探索低成本算法与基础夯实:**V1模型的核心目标是在确保效果的前提下,探索低成本算法,并开展Scaling Laws实验以筑牢基础。它沿用了LLaMA 2的稠密(Dense)模型架构,并以2万亿Token的中英双语数据为基础,进行超参数与模型规模/数据配比的Scaling Laws实验。在后续训练阶段,V1模型采用了SFT(Supervised Fine-Tuning)和DPO(Direct Preference Optimization)算法,凭借这些优化手段,在多个维度上超越了LLaMA 2 70B模型。
通过这篇论文的标题可看出,Deepseek旨在通过长期主义视角推进开源大模型的发展。文章主要解决了以下两个关键问题:
Deepseek通过许多渠道(一般来说有四种:开源数据、自己爬、自己标、找其他公司买数据。当时合成数据还属于探索阶段)获取到大量的原始数据,但这些数据存在大量重复和无效内容、数据比例失衡等问题,因此需要对数据进行清洗。他的数据构建方法分为三个关键阶段:去重、过滤和混洗。通过清洗后,得到一个包含 2 万亿Token的中英双语预训练数据集,比 LLaMA 2数据量更大。
去重阶段
过滤阶段
混洗阶段