待验证50% 置信基准精确时间
在8GB显存的消费级显卡上,ActionAssist以Q6_K_L量化格式配合32k上下文窗口和8位KV缓存量化,能够达到122 tokens/秒的推理速度
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证典型7B模型(32层、32头、128维度)在FP16精度下处理2048 token序列、批大小8时,KV Cache约消耗4GB显存73% 相似待验证8GB显存的显卡在运行Q4量化的9B模型时,可以将上下文窗口扩展到8192-16384 token72% 相似待验证在12GB显存的显卡上运行9B模型时,通常采用4-bit量化(如Q4_K_M格式)以降低显存占用72% 相似已验证以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB71% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/912378API
curl https://kongchang.com/api/v1/knowledge/claims/912378MCP
get_claim(id=912378)