Unverified50% confidenceBenchmarkExact time
Strata是一个开源推理运行时,能在RTX 5070(12GB显存)上运行1250亿参数的Qwen3.8 Flash Next模型,输出速度约为每秒90个Token
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/5/2026
First Seen
Valid until: 1/3/2027
Sources
Related Entities
Related Claims
Verified在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒75% similarUnverified旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力72% similarUnverified约8亿参数的Qwen3.5生成速度最快,接近每秒15个令牌,第二名LFM2.5超过每秒10个令牌71% similarVerified在RTX 5090上,Muse Glimmer生成速度从每秒75个Token提升到233个Token,提速约3.1倍69% similarUnverifiedQwen3 Flash Next在本地运行中开发者Primitive报告的生成速度达到142.6 tokens/s69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/978610API
curl https://kongchang.com/api/v1/knowledge/claims/978610MCP
get_claim(id=978610)