Unverified50% confidenceBenchmarkExact time
约1.6M超长上下文配合128并发时,吞吐可达约3700 tokens/s(聚合)
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/28/2026
First Seen
Valid until: 12/27/2026
Sources
Related Entities
Related Claims
Unverified128K 字符的输出上限约相当于 3-4 万个 token75% similarUnverified社区横向对比数据:M2 Ultra约20 token/秒,M3 Ultra 512GB为39.8 token/秒,单张B200为119.7 token/秒,8张RTX Pro 6000约204 token/秒,改装48GB显存RTX 4090定制后端367 token/秒,双H200约375 token/秒73% similarUnverified若带宽达到2.4TB/s,100GB模型理论速度上限可达24 token/s,60GB模型40 token/s,35GB模型接近69 token/s73% similarUnverified4-5 token/秒的速度对于8GB显卡的实际使用而言太慢,16GB显卡可提升到12-14 token/秒进入实际可用范围73% similarUnverified官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/956040API
curl https://kongchang.com/api/v1/knowledge/claims/956040MCP
get_claim(id=956040)