待验证50% 置信预测精确时间
作者预测若Qwen团队推出针对TP4优化的Flash版本,可将DGX Spark上的推理速度提升至100 token/s级别
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证在双Spark TP2配置下,Qwen 3.8 Flash推理速度为55-70 token/s,支持4个全并发智能体同时运行75% 相似待验证针对4×DGX Spark用户推荐分层部署:监督者智能体TP4运行GLM 5.3 Flash,工作者智能体运行Qwen 27B,子智能体运行Qwen 3.6 35B70% 相似部分验证Qwen3.8-Flash-Next 采用 125B 总参数、6B 激活参数的混合专家(MoE)架构67% 相似待验证阿里通义千问正式发布Qwen3.8-Flash-Next(千问308 Flash NEX)模型,总参数高达181.5B66% 相似待验证在官方演示中,PAIR能把Qwen模型分配到RTX 5090、把Qwen MoE模型分配到DGX Spark,并能与Radeon显卡协同65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/904313API
curl https://kongchang.com/api/v1/knowledge/claims/904313MCP
get_claim(id=904313)