Unverified50% confidenceBenchmarkExact time
在单张 32GB 显卡、q4_0 量化场景下,上下文长度从更新前的 82,432 token 增至更新后的 199,680 token
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/7/2026
First Seen
Valid until: 10/5/2026
Sources
Unsloth重大更新:GLM-5.2支持、3倍长上下文与全新Model Hub
rss6/22/2026
Related Claims
Unverified在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s73% similarUnverified8GB显存的显卡在运行Q4量化的9B模型时,可以将上下文窗口扩展到8192-16384 token72% similarUnverified使用IQ4_XS配合-fa 1 -ctk q8_0 -ctv q8_0对KV缓存进行q8_0量化后,可加载完整32k上下文,常驻内存约16.6GB70% similarUnverified170k tokens场景下,注意力得分矩阵在BF16精度下约需54GB显存(170000×170000×2字节)69% similarUnverified以Q4_0格式为例,每32个FP32权重被打包为一个量化块,包含一个缩放因子和32个4bit整数,平均每参数约占4.5bit,内存占用缩减至原来的约1/869% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/172807API
curl https://kongchang.com/api/v1/knowledge/claims/172807MCP
get_claim(id=172807)