待验证50% 置信事实精确时间
70B参数模型(140GB权重)在1TB/s带宽下理论最快生成速度约7 tokens/秒
1
来源数
50%
置信度
长期有效
时效性
2026/9/7
首次发现
来源
相关事实
待验证若量化后模型权重为150GB,以273GB/s带宽读取一遍权重约需0.55秒,理论上单token生成速度约为1.8 token/s(未计入计算延迟和跨机通信开销)80% 相似待验证128GB DDR5内存能完整加载70B级别模型的所有权重,但速度约为2-5 tokens/s77% 相似待验证Quantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型75% 相似待验证M2 Max(96GB统一内存)理论上可流畅运行70B级别的量化模型74% 相似部分验证对于7B参数模型的4-bit量化版本,通常需要至少8GB内存和现代多核CPU即可流畅运行,推理速度约为每秒10-30个token74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/870301API
curl https://kongchang.com/api/v1/knowledge/claims/870301MCP
get_claim(id=870301)