Unverified50% confidenceBenchmarkExact time
路径A中RTX 3060跑前段层、AMD AI Max+ 395跑后段层,在IQ3量化64K长输入下Prefill速度从136.69 token/s提升到319.1 token/s
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/26/2026
First Seen
Valid until: 12/25/2026
Sources
Related Entities
Related Claims
Unverified生成速度上Ollama区间339-448 Token/s(峰值448),OpenCode Go区间293-354(峰值354)72% similarUnverified在128K上下文下,Q2_0输出65.1 tok/s、IQ2_XS输出52.0 tok/s、IQ3_XXS输出44.8 tok/s67% similarUnverifiedQwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s67% similarUnverified完成250案例测试,FP8 27B用时36分27秒,Flash-Next IQ4_XS用时2小时05分47秒,相差约3.5倍61% similarUnverified在Gemma 4 12B模型的Token生成测试中,Spark达26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快33.8 tokens/s61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/952580API
curl https://kongchang.com/api/v1/knowledge/claims/952580MCP
get_claim(id=952580)