待验证50% 置信事实精确时间
8GB显存的显卡在运行Q4量化的9B模型时,可以将上下文窗口扩展到8192-16384 token
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
本地部署免费AI智能体:千问3.5+Hormis打造全能助手
bilibili愈解忧2026/6/22
相关事实
待验证8GB 显存适合运行 7B 模型的 Q4/Q5 量化版(全部层上 GPU),12GB 显存可以运行 14B 模型的 Q4 量化版或 7B 的 Q8 版本74% 相似待验证在16GB内存硬件条件下只能容纳5GB以内的模型,因此该开发者使用了体积约4.8GB的Qwen 2.5 7B 4bit量化模型,配8K上下文窗口73% 相似待验证在单张 32GB 显卡、q4_0 量化场景下,上下文长度从更新前的 82,432 token 增至更新后的 199,680 token72% 相似待验证使用IQ4_XS配合-fa 1 -ctk q8_0 -ctv q8_0对KV缓存进行q8_0量化后,可加载完整32k上下文,常驻内存约16.6GB71% 相似待验证典型7B模型(32层、32头、128维度)在FP16精度下处理2048 token序列、批大小8时,KV Cache约消耗4GB显存70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/40879API
curl https://kongchang.com/api/v1/knowledge/claims/40879MCP
get_claim(id=40879)