核心原理与架构技术

聚焦LLM的底层机制、训练技术与模型结构

预训练优化器—BPE vs WordPiece

预训练优化器—神经网络的优化器

预训练精度—FP16、FP32、BF16

预训练激活函数—GLU和SwiGLU激活函数

预训练注意力机制—ALiBi

混合专家模型 (MoE) 详解

旋转位置编码-RoPE

Flash Attention-1论文解读

从ROPE到Yarn, 一条通用公式速通长文本大模型中的位置编码

DeepSeek-V3技术报告

DeepSeek V1/V2/V3/R1进化史

从Transformers (2017) 到 DeepSeek-R1 (2025)

DeepSeek开源周技术总览

快手OneRec技术报告

美团LongCat-Flash技术报告