待验证50% 置信基准精确时间
在1200亿参数的GPT-OSS 120B上token生成从90提升到130 tokens/s,PP从约1300提升到约3200 tokens/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/23
首次发现
有效期至:2026/12/22
来源
涉及实体
相关事实
待验证用2840亿参数的DeepSeek V4 Flash实测,token生成从37提升到53 tokens/s(约1.5倍),Prompt Processing从483跃升到1485 tokens/s(约三倍)69% 相似待验证以 Llama-3 70B 为例,在 A100 80GB GPU 上处理 32K token 的预填充阶段约需 800-1200ms,而处理 2K token 仅需约 50ms67% 相似待验证UP主估计使用50GB显存显卡后推理速度可能提升到30~40 tokens/s(未经实测确认)67% 相似待验证200K token的上下文请求相比8K token请求,需要约25倍的KV-Cache显存66% 相似待验证H100的内存带宽约3.35TB/s,GPT-4规模模型单次生成一个Token需读取约1TB参数数据,理论上每秒最多生成约3个Token66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/944881API
curl https://kongchang.com/api/v1/knowledge/claims/944881MCP
get_claim(id=944881)