待验证50% 置信基准精确时间
OpenAI 的 GPT-OSS 20B 实测速度超过 21 Token/秒,接近稠密 12B 模型的两倍
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/19
首次发现
有效期至:2026/12/18
来源
涉及实体
相关事实
待验证测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上76% 相似待验证GPT-OSS 20B推理仅需16G显存,微调仅需24G显存75% 相似待验证GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升75% 相似待验证GPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s74% 相似待验证2B模型单次推理约需4-10 TFLOPs计算量,在A100 GPU上耗时10-50毫秒;而70B模型需140-350 TFLOPs,耗时可达数秒74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/933720API
curl https://kongchang.com/api/v1/knowledge/claims/933720MCP
get_claim(id=933720)