https://github.com/deepseek-ai/FlashMLA
DeepSeek “开源周” 今日正式开启,首个开源的代码仓库为 FlashMLA—— 针对 Hopper GPU(一种英伟达图形处理器架构)优化的高效 MLA(多头潜注意力) 解码内核,专为处理可变长度序列而设计,目前已投入生产环境。
据介绍,FlashMLA 专门针对多层注意力机制进行了优化,能够加速 LLM 的解码过程,从而提高模型的响应速度和吞吐量。FlashMLA 可在 H800 芯片上实现最高 3000GB/S 的带宽和 580 TFLOPS 的算力。
FlashMLA 的主要应用场景包括:
目前 AI 训练或推理主要依赖英伟达 H100 / H800,但软件生态还在完善。
由于 FlashMLA 的开源,未来它可以被集成到 vLLM(高效 LLM 推理框架)、Hugging Face Transformers 或 Llama.cpp(轻量级 LLM 推理) 生态中,从而有望让开源大语言模型(如 LLaMA、Mistral、Falcon)运行得更高效。
https://github.com/vllm-project/vllm/pull/13747
https://github.com/sgl-project/sglang/issues/4006
对于 AI 公司或者云计算服务商来说,使用 FlashMLA 也就意味着更低的成本、更快的推理,让更多 AI 公司、学术机构、企业用户直接受益,提高 GPU 资源的利用率。