待验证60% 置信事实时间未知
Mercury 2 实测生成速度达到每秒超过 1000 个 Token
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Mercury 2 实测:扩散模型驱动的最快推理大模型,18秒生成完整游戏
bilibiliAI-seeker
涉及实体
相关事实
待验证Halo预填充成绩650 tokens/s几乎是同一颗芯片去年测速的两倍,提升源自AMD向llama.cpp等上游开源项目贡献代码推进ROCm生态成熟60% 相似待验证一个800万参数(8.3M)的沙盒引擎在2019年发布的6核桌面CPU上跑出约2000 tokens/秒的解码速度59% 相似待验证在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍56% 相似待验证基于MLX框架,顶配Mac机型运行Llama-3-70B量化模型可达约20 tokens/秒的生成速度56% 相似待验证在对照测试中,35B模型速度约100 tokens/秒(Mac Studio),是9B模型16 tokens/秒的约五倍56% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/14048API
curl https://kongchang.com/api/v1/knowledge/claims/14048MCP
get_claim(id=14048)