待验证50% 置信事实精确时间
全参数微调通常需要模型参数量3-5倍的GPU显存
1
来源数
50%
置信度
长期有效
时效性
2026/9/10
首次发现
来源
涉及实体
相关事实
待验证以GPT-3的1750亿参数为例,大约2/3的参数分布在FFN层中,1/3在注意力层中65% 相似待验证推测解码中draft模型参数量通常约为目标模型的1/10到1/5,候选数k通常为4-865% 相似待验证GPTQ(2022)通过逐层量化并利用 Hessian 信息最小化量化误差,首次实现了大模型在 INT4 下的可用表现64% 相似待验证响应时间只看厂商标称的1ms/0.5ms GtG意义不大,应看RTINGS等第三方实测的过冲(overshoot)数据,标称与实测常差2-3倍64% 相似待验证MoE 模型每次推理仅激活总参数量的一小部分,Qwen3 Max 每次推理激活量可能为总量的1/8至1/1664% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/889945API
curl https://kongchang.com/api/v1/knowledge/claims/889945MCP
get_claim(id=889945)