待验证50% 置信基准精确时间
Collapse推理速度:CPU上单条10-token上下文约0.23毫秒,MPS在batch 1024下约230万token/秒,最近邻查询约0.48毫秒
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
无需MLP与注意力机制:点吸引子动力学如何学习词嵌入
redditr/learnmachinelearning2026/7/10
相关事实
待验证看芯片而非标称速率:搭载骁龙X62/X65基带的下行可达4-10Gbps,而入门级骁龙X55/X12方案实际下行约1-2Gbps,标称峰值速率在弱信号下参考意义有限73% 相似待验证写入速度实测通常在260MB/s左右,虽达V90标准但低于标称读取300MB/s,连拍缓存清除速度属同级主流水平72% 相似待验证Gemma量化模型在高性能笔记本电脑上Token生成速度可达每秒20-50个,纯CPU推理约5-15 tokens/秒,INT4量化下NVIDIA RTX 4060/4070可将推理速度提升3-5倍72% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒72% 相似待验证华为云ASS零区计算集群支持10万卡规模算力,Token生成延迟压缩到10毫秒以内,算力达到2001 PFLOPS71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/491364API
curl https://kongchang.com/api/v1/knowledge/claims/491364MCP
get_claim(id=491364)