Unverified50% confidenceBenchmarkExact time
在27B混合架构、4B稠密模型、36B MoE三类模型上以8k上下文测试,Prefill阶段性能无变化,Decode阶段打补丁后快约1.4%
1
Sources
50%
Confidence
Long-term
Relevance
7/25/2026
First Seen
Sources
三行代码修复:Tesla P100在llama.cpp中精度提升2300倍
redditr/LocalLLaMA7/12/2026
Related Claims
UnverifiedMiniCPM 系列以 2B-4B 级别的参数量在多项基准测试中实现了接近 7B 甚至 13B 模型的性能71% similarUnverified14B MoE模型基于Qwen3.6 35B MoE压缩而来,总参数从35B压缩到14B,但每次激活参数仍为3B,与原版35B完全一致69% similarVerified模型参数量越大,对量化的鲁棒性越强,使得70B级别模型在4-bit量化后仍能保持接近FP16的性能69% similarUnverified混元3是混合专家模型(MoE),总参数量为295B,激活参数约21B68% similarUnverified千问3.6的35B MOE模型每次只激活其中3B的参数68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/613152API
curl https://kongchang.com/api/v1/knowledge/claims/613152MCP
get_claim(id=613152)