模型Flash Next 125B
Flash Next
一个标称125B参数的大语言模型,采用混合专家(MoE)架构,其中约121B为MoE部分,支持Q4/Q2K量化部署
时间轴 (近 90 天)
10月5日
在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18
待验证50%
10月5日
该125B模型主干中约121B是混合专家(MoE)部分,另有约51B的PLE查找表以及约4B的MTP模块,完整检查点接近180B
待验证50%
10月5日
该模型每层有512个专家,但每个token只激活其中10个,真正参与计算的权重约6B
待验证60%
10月5日
三套优化叠加后生成速度稳定在每秒9到10个token,但1万字长文的首字响应仍需等待约329秒
待验证50%