待验证50% 置信事实精确时间
推理时需要额外的KV Cache显存,意味着实际资源占用可能高于模型文件本身
1
来源数
50%
置信度
长期有效
时效性
2026/7/7
首次发现
来源
Chrome悄悄安装4GB本地AI模型:端侧AI时代的透明度之争
hackernewshackernews2026/7/6
相关事实
待验证长文档处理中,KV Cache机制导致显存占用随上下文长度近似平方级增长72% 相似待验证上下文越长,KV Cache 占用的显存成比例增加,手动调大上下文长度需确保剩余显存充足,否则可能出现显存溢出(OOM)导致崩溃71% 相似待验证微调允许模型调整表征以更好服务下游任务,但需要更多标注数据和计算资源,且存在灾难性遗忘的风险71% 相似待验证Reasoning Effort档位越高,模型可消耗的思考Token上限越大,但延迟和Token成本相应线性乃至超线性增长69% 相似待验证Token压缩存在权衡:某些看似冗余的上下文信息可能对模型推理至关重要,激进压缩可能影响代码生成、复杂推理等场景的输出质量67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/172370API
curl https://kongchang.com/api/v1/knowledge/claims/172370MCP
get_claim(id=172370)