待验证50% 置信基准精确时间
SGLang 使用官方 NVFP4 权重配合 D-Spark 投机解码在 Blackwell GPU 上跑出平均约 173 tokens/秒,短任务逼近 200,同时加载 262k 上下文窗口
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/16
首次发现
有效期至:2026/12/15
来源
涉及实体
相关事实
待验证以 Llama-3 70B 为例,在 A100 80GB GPU 上处理 32K token 的预填充阶段约需 800-1200ms,而处理 2K token 仅需约 50ms72% 相似待验证本地部署DS4模型在STM32嵌入式开发测试中平均输出速度约为23 tokens/秒,推理时内存占用飙升至110GB,峰值速度达83.8 tokens/秒70% 相似待验证GPT-4级别模型的128K上下文窗口的KV缓存可能占用数十GB显存70% 相似待验证GPU 在大模型推理时的核心瓶颈是内存带宽,自回归生成每个 Token 需从 HBM 加载完整 KV Cache,计算利用率通常不到 5%69% 相似待验证在A100(80GB显存)GPU上,训练7B模型的吞吐量约为每秒3000-5000 token69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/924475API
curl https://kongchang.com/api/v1/knowledge/claims/924475MCP
get_claim(id=924475)