待验证50% 置信注意事项精确时间
模型哪怕一小部分溢出到系统内存,速度会大幅下降;实验显示同一小模型在RTX 5090显存跑151 tokens/s,放进系统内存只剩8 tokens/s
1
来源数
50%
置信度
长期有效
时效性
2026/10/4
首次发现
来源
涉及实体
相关事实
待验证Windows上运行该模型比Linux慢约20%,短上下文约16 tokens/s,长上下文约10 tokens/s74% 相似待验证Quantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型70% 相似已验证当显存不足时,系统会将模型的一部分卸载到主内存中运行,此时主内存的容量与带宽直接影响推理速度70% 相似待验证当模型文件超出显卡显存时,溢出部分退回系统内存处理,速度会大幅下降70% 相似待验证本地模型推理速度慢(约1-5 tokens/秒)而云端可达50+ tokens/秒,本地模型能力天花板较低但无API成本和隐私顾虑69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/973166API
curl https://kongchang.com/api/v1/knowledge/claims/973166MCP
get_claim(id=973166)