待验证50% 置信基准精确时间
约1.6M超长上下文配合128并发时,吞吐可达约3700 tokens/s(聚合)
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/28
首次发现
有效期至:2026/12/27
来源
涉及实体
相关事实
待验证128K 字符的输出上限约相当于 3-4 万个 token75% 相似待验证社区横向对比数据:M2 Ultra约20 token/秒,M3 Ultra 512GB为39.8 token/秒,单张B200为119.7 token/秒,8张RTX Pro 6000约204 token/秒,改装48GB显存RTX 4090定制后端367 token/秒,双H200约375 token/秒73% 相似待验证若带宽达到2.4TB/s,100GB模型理论速度上限可达24 token/s,60GB模型40 token/s,35GB模型接近69 token/s73% 相似待验证4-5 token/秒的速度对于8GB显卡的实际使用而言太慢,16GB显卡可提升到12-14 token/秒进入实际可用范围73% 相似待验证官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/956040API
curl https://kongchang.com/api/v1/knowledge/claims/956040MCP
get_claim(id=956040)