待验证50% 置信事实精确时间
在一个700亿参数模型双显卡场景下,用户实测llama.cpp提示词读取速度为每秒1490 token而KoboldCpp仅34,原因是设置错误而非引擎缺陷
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/20
首次发现
有效期至:2026/12/19
来源
涉及实体
相关事实
待验证在 AMD RX 7900 显卡实测中,Ornith 35B 总体准确率 85%(21 项通过 18 项),生成速度 74 tokens/秒,提示词处理 850 tokens/秒,显存占用 20GB66% 相似待验证在8GB显存的消费级显卡上,ActionAssist以Q6_K_L量化格式配合32k上下文窗口和8位KV缓存量化,能够达到122 tokens/秒的推理速度65% 相似待验证RTX 4090的理论FP16算力为330 TFLOPS,对于7B FP16模型的Decode实际速度通常在50-60 tokens/s65% 相似待验证实际持续写入速度低于标称的300MB/s读取速度,写入速度通常在260MB/s左右,但在SD卡中仍属顶级水平65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/937564API
curl https://kongchang.com/api/v1/knowledge/claims/937564MCP
get_claim(id=937564)