Unverified50% confidenceFactExact time
全参数微调通常需要模型参数量3-5倍的GPU显存
1
Sources
50%
Confidence
Long-term
Relevance
9/10/2026
First Seen
Sources
Related Entities
Related Claims
Unverified以GPT-3的1750亿参数为例,大约2/3的参数分布在FFN层中,1/3在注意力层中65% similarUnverified推测解码中draft模型参数量通常约为目标模型的1/10到1/5,候选数k通常为4-865% similarUnverifiedGPTQ(2022)通过逐层量化并利用 Hessian 信息最小化量化误差,首次实现了大模型在 INT4 下的可用表现64% similarUnverified响应时间只看厂商标称的1ms/0.5ms GtG意义不大,应看RTINGS等第三方实测的过冲(overshoot)数据,标称与实测常差2-3倍64% similarUnverifiedMoE 模型每次推理仅激活总参数量的一小部分,Qwen3 Max 每次推理激活量可能为总量的1/8至1/1664% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/889945API
curl https://kongchang.com/api/v1/knowledge/claims/889945MCP
get_claim(id=889945)