Unverified50% confidenceBenchmarkExact time
在超长上下文测试中,Ornith 1.5早期约75 token/秒,超过160万token后降至约45 token/秒,而Qwen 3.8在相同负载下降至约5 token/秒
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
Unverified在TP4张量并行配置下,QWEN 3.8峰值可达100–115 Token/秒66% similarUnverifiedQwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s65% similarUnverified投机采样中当候选 token 的接受率较高时,每次前向传播的有效输出 token 数量可达 2~4 个,从而将整体生成速度提升 1.5x~3x61% similarUnverified在Gemma 4 12B模型的Token生成测试中,Spark达26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快33.8 tokens/s59% similarUnverifiedOrnith 35B MoE 约 30 秒给出三神问题的正确答案,而 Ornith 9B 和原始千问 3.5-9B 均未通过59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/907313API
curl https://kongchang.com/api/v1/knowledge/claims/907313MCP
get_claim(id=907313)