核心原理与架构技术
聚焦LLM的底层机制、训练技术与模型结构
- 预训练(优化器、精度、MoE、ALiBi、激活函数等)
- 后训练:指令微调、对齐
- 分词与架构(BPE、GLU/SwiGLU)
预训练优化器—BPE vs WordPiece
预训练优化器—神经网络的优化器
预训练精度—FP16、FP32、BF16
预训练激活函数—GLU和SwiGLU激活函数
预训练注意力机制—ALiBi
混合专家模型 (MoE) 详解
旋转位置编码-RoPE
Flash Attention-1论文解读
从ROPE到Yarn, 一条通用公式速通长文本大模型中的位置编码
DeepSeek-V3技术报告
DeepSeek V1/V2/V3/R1进化史
从Transformers (2017) 到 DeepSeek-R1 (2025)
DeepSeek开源周技术总览
快手OneRec技术报告
美团LongCat-Flash技术报告