待验证50% 置信事实精确时间
云端API通常能达到每秒数十到上百个token的输出速度,而消费级GPU运行27B模型速度往往只有每秒10-30个token
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/22
首次发现
有效期至:2026/12/21
来源
涉及实体
相关事实
待验证主流GPU推理方案(如基于NVIDIA H100的部署)在27B规模模型上通常只能达到每秒数十到一两百token的水平80% 相似待验证全精度视频扩散模型推理通常需要24GB以上VRAM的GPU,而0.4MP配10步Turbo加速可能将显存需求降至12-16GB级别75% 相似待验证OpenAI 的 GPT-OSS 20B 实测速度超过 21 Token/秒,接近稠密 12B 模型的两倍75% 相似待验证实现「快过播放」的视频生成极可能使用了NVIDIA最新一代数据中心GPU(如H100或即将推出的B系列),在消费级GPU(如RTX 4090)上相同模型的推理速度可能慢5-10倍74% 相似待验证将模型权重从FP16压缩到INT8或INT4的量化技术,可使消费级GPU如RTX 4090在本地部署时达到30-80 TPS的实用速度74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/942053API
curl https://kongchang.com/api/v1/knowledge/claims/942053MCP
get_claim(id=942053)