待验证50% 置信事实精确时间
华为云ASS零区计算集群支持10万卡规模算力,Token生成延迟压缩到10毫秒以内,算力达到2001 PFLOPS
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
阶跃星辰STEP3.7 Flash登顶AA榜,多模态推理速度起飞
bilibiliAI天天酱2026/6/6
相关事实
待验证Collapse推理速度:CPU上单条10-token上下文约0.23毫秒,MPS在batch 1024下约230万token/秒,最近邻查询约0.48毫秒71% 相似待验证使用FWHT处理1024维向量仅需约10240次运算,而直接矩阵乘法需约100万次,接近100倍加速70% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒68% 相似待验证测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上68% 相似待验证DeepSeek V4 Flash在OpenModel平台的速率限制为每分钟10次请求(10 RPM)和每分钟100K tokens(100K TPM)66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/53772API
curl https://kongchang.com/api/v1/knowledge/claims/53772MCP
get_claim(id=53772)