待验证50% 置信基准精确时间
路径A中RTX 3060跑前段层、AMD AI Max+ 395跑后段层,在IQ3量化64K长输入下Prefill速度从136.69 token/s提升到319.1 token/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/26
首次发现
有效期至:2026/12/25
来源
涉及实体
相关事实
待验证生成速度上Ollama区间339-448 Token/s(峰值448),OpenCode Go区间293-354(峰值354)72% 相似待验证在128K上下文下,Q2_0输出65.1 tok/s、IQ2_XS输出52.0 tok/s、IQ3_XXS输出44.8 tok/s67% 相似待验证Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s67% 相似待验证完成250案例测试,FP8 27B用时36分27秒,Flash-Next IQ4_XS用时2小时05分47秒,相差约3.5倍61% 相似待验证在Gemma 4 12B模型的Token生成测试中,Spark达26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快33.8 tokens/s61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/952580API
curl https://kongchang.com/api/v1/knowledge/claims/952580MCP
get_claim(id=952580)