待验证50% 置信观点精确时间
一个经过良好微调的27B-32B模型运行成本仅为400B+级别模型的十分之一
1
来源数
50%
置信度
长期有效
时效性
2026/8/26
首次发现
来源
涉及实体
相关事实
待验证测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上67% 相似已验证一个原本需要60GB显存的30B参数模型,经过量化后能在16GB甚至8GB显存的消费级显卡上运行67% 相似已验证32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行67% 相似待验证GPT-OSS 120B以不到一半的参数量和硬件成本超越了千问3 235B AR2B推理模型的性能66% 相似待验证单卡A100(80GB显存)可运行7B-13B级别模型,4卡A100(320GB显存)可运行70B级别模型65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/802084API
curl https://kongchang.com/api/v1/knowledge/claims/802084MCP
get_claim(id=802084)