待验证50% 置信基准精确时间
GFX1151 Engine在AMD 395上的解码(对话生成)速度为每秒30到40 token,具体取决于投机采样的接受率
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证在 AMD RX 7900 显卡实测中,Ornith 35B 总体准确率 85%(21 项通过 18 项),生成速度 74 tokens/秒,提示词处理 850 tokens/秒,显存占用 20GB75% 相似待验证RTX 4090的理论FP16算力为330 TFLOPS,对于7B FP16模型的Decode实际速度通常在50-60 tokens/s72% 相似待验证在6张RTX 5090上Colibri实测速度达9.0-9.2 token/s,在25GB开发机上从NVMe流式读取速度为0.05-0.1 token/s70% 相似已验证在RTX 5090上,Muse Glimmer生成速度从每秒75个Token提升到233个Token,提速约3.1倍69% 相似待验证在一个700亿参数模型双显卡场景下,用户实测llama.cpp提示词读取速度为每秒1490 token而KoboldCpp仅34,原因是设置错误而非引擎缺陷69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/978818API
curl https://kongchang.com/api/v1/knowledge/claims/978818MCP
get_claim(id=978818)