[KongchangAI]
ModelFlash Next 125B

Flash Next

一个标称125B参数的大语言模型,采用混合专家(MoE)架构,其中约121B为MoE部分,支持Q4/Q2K量化部署

Timeline (last 90 days)

Oct 5

在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18

Unverified50%
Oct 5

该125B模型主干中约121B是混合专家(MoE)部分,另有约51B的PLE查找表以及约4B的MTP模块,完整检查点接近180B

Unverified50%
Oct 5

该模型每层有512个专家,但每个token只激活其中10个,真正参与计算的权重约6B

Unverified60%
Oct 5

三套优化叠加后生成速度稳定在每秒9到10个token,但1万字长文的首字响应仍需等待约329秒

Unverified50%

All Facts (4)

Source Articles