待验证50% 置信基准精确时间
在单张 32GB 显卡、q4_0 量化场景下,上下文长度从更新前的 82,432 token 增至更新后的 199,680 token
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/7
首次发现
有效期至:2026/10/5
来源
Unsloth重大更新:GLM-5.2支持、3倍长上下文与全新Model Hub
rss2026/6/22
相关事实
待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s73% 相似待验证8GB显存的显卡在运行Q4量化的9B模型时,可以将上下文窗口扩展到8192-16384 token72% 相似待验证使用IQ4_XS配合-fa 1 -ctk q8_0 -ctv q8_0对KV缓存进行q8_0量化后,可加载完整32k上下文,常驻内存约16.6GB70% 相似待验证170k tokens场景下,注意力得分矩阵在BF16精度下约需54GB显存(170000×170000×2字节)69% 相似待验证以Q4_0格式为例,每32个FP32权重被打包为一个量化块,包含一个缩放因子和32个4bit整数,平均每参数约占4.5bit,内存占用缩减至原来的约1/869% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/172807API
curl https://kongchang.com/api/v1/knowledge/claims/172807MCP
get_claim(id=172807)