待验证50% 置信事实精确时间
作者在DGX Spark上跑通演示,CLM服务器本身约75MB,整体占用约25GB显存,缓存后同一工单再次询问可在2毫秒内返回
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/4
首次发现
有效期至:2027/1/2
来源
涉及实体
相关事实
待验证开启本地推理后,整个服务会占用DGX Spark 128GB内存中的约100GB,剩余约28GB可支撑其他应用74% 相似待验证若量化后模型权重为150GB,以273GB/s带宽读取一遍权重约需0.55秒,理论上单token生成速度约为1.8 token/s(未计入计算延迟和跨机通信开销)68% 相似待验证在M4 Pro芯片、24GB统一内存的MacBook Pro上通过llama.cpp运行,文本解码速度为10.13 tokens/秒,完整任务每个耗时4到7分钟66% 相似待验证以 LLaMA-2 70B 为例,每次完整推理需从存储加载约 140GB 权重数据,以 5GB/s 的 SSD 读速估算仅数据加载时间就约需 28 秒65% 相似待验证三任务并行测试中,Mac mini的32GB内存被聊天机器人和Flux占满导致Blender无法启动,Flux绘图速度从12秒骤降到近4分钟一张,而256GB内存的Mac Studio可完整运行全部三个任务30分钟65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/973480API
curl https://kongchang.com/api/v1/knowledge/claims/973480MCP
get_claim(id=973480)