Unverified50% confidenceBenchmarkExact time
社区横向对比数据:M2 Ultra约20 token/秒,M3 Ultra 512GB为39.8 token/秒,单张B200为119.7 token/秒,8张RTX Pro 6000约204 token/秒,改装48GB显存RTX 4090定制后端367 token/秒,双H200约375 token/秒
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
Unverified在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒73% similarUnverifiedM3原始权重存储下限:BF16约854GB,8-bit约428GB,4-bit约214GB70% similarUnverified在单张 32GB 显卡、q4_0 量化场景下,上下文长度从更新前的 82,432 token 增至更新后的 199,680 token70% similarUnverified在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/897655API
curl https://kongchang.com/api/v1/knowledge/claims/897655MCP
get_claim(id=897655)