https://mp.weixin.qq.com/s/L6ksiCP6z84NeKNZ1h6OoA
LongCat-Flash,一个拥有 5600 亿参数的专家混合 (Mixture-of-Experts, MoE) 语言模型,旨在兼顾计算效率与先进的智能体 (Agentic) 能力。为满足可扩展效率的需求,LongCat-Flash 采用了两项新颖设计: a) 零计算专家 (Zero-computation Experts):此机制能够实现动态计算预算分配,根据上下文需求为每个词元(token)激活 186 亿至 313 亿(平均 270 亿)不等的参数,从而优化资源利用。 b) 快捷连接 MoE (Shortcut-connected MoE):此设计扩大了计算与通信的重叠窗口,与同等规模的模型相比,在推理效率和吞吐量方面展现出显著的提升。