Unverified50% confidenceBenchmarkExact time
在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/5/2026
First Seen
Valid until: 1/3/2027
Sources
Related Entities
Related Claims
Unverified实测在RTX 3060(6GB显存)、32GB RAM上运行预量化Krea2 Turbo,1024×1024分辨率8步Euler采样,速度为1.78 s/it,总耗时17.64秒78% similarUnverified旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力74% similarUnverified在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/978651API
curl https://kongchang.com/api/v1/knowledge/claims/978651MCP
get_claim(id=978651)