待验证50% 置信基准精确时间
IQ4_XS量化文件大小15.57GB,pp2048为95.4 tok/s,tg128为10.9 tok/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/21
首次发现
有效期至:2026/11/19
来源
相关事实
待验证Q4_K_M量化文件大小17.77GB,pp2048速度96.8 tok/s,tg128速度11.4 tok/s78% 相似待验证使用IQ4_XS配合-fa 1 -ctk q8_0 -ctv q8_0对KV缓存进行q8_0量化后,可加载完整32k上下文,常驻内存约16.6GB71% 相似待验证UD-Q4_K_XL量化版本体积155GB,Top-1精度为96%71% 相似待验证IQ2_XS可以将模型压缩到接近2 bit/权重,使原本需要48GB显存的70B模型能塞入24GB消费级显卡70% 相似待验证RTX 5090上Qwen3.6 35B-A3B推理速度达220 token/s,显存占用约23GB70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/781391API
curl https://kongchang.com/api/v1/knowledge/claims/781391MCP
get_claim(id=781391)