待验证50% 置信事实精确时间
Qwen3.8-Flash-Next采用GDN加QSA的混合注意力机制,总参数125B外加51B的N-gram嵌入,每个Token仅激活约6B参数
1
来源数
50%
置信度
长期有效
时效性
2026/9/5
首次发现
来源
涉及实体
相关事实
待验证Qwen3.8-Flash-Next 采用 125B 总参数、6B 激活参数的混合专家(MoE)架构76% 相似待验证GLM-5.3-Flash采用稀疏注意力与线性注意力的混合架构,并完全运行于国产AI芯片集群66% 相似待验证第一代Qwen起步上下文窗口为2048,通过NTK插值外推到8192,训练使用Flash Attention、AdamW优化器和BF16混合精度65% 相似待验证LLaMA-2 70B采用80层、64个注意力头的架构,并使用GQA(8个KV头共享64个Q头)65% 相似待验证GLM-5.3-Flash来自Z.ai,是一款总参数量320B(3200亿)的多模态MoE模型,任意时刻仅激活18B参数63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/862164API
curl https://kongchang.com/api/v1/knowledge/claims/862164MCP
get_claim(id=862164)