待验证50% 置信事实精确时间
FFN前馈网络模块通过up层将向量升维(如4K→8K),经过激活函数(如SwiGLU门控激活),再通过down层降回原维度
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证量化技术将神经网络权重从高精度浮点数(如FP32、FP16)压缩为低位整数(如INT8、INT4),现代量化方案包括GPTQ、AWQ、GGUF的K-quant系列61% 相似待验证FP8量化将模型权重从FP16压缩为8位浮点表示,在NVIDIA Hopper架构(H100/H200)上可获得原生加速,且相比INT8对精度损失更小60% 相似待验证MoE架构将标准Transformer的FFN层替换为N个并行专家子网络,并通过门控路由网络每次选择Top-K个专家进行计算(通常K=2),实现稀疏激活58% 相似待验证FP8主要有E4M3(4位指数+3位尾数)和E5M2(5位指数+2位尾数)两种子格式,分别针对前向传播和反向传播优化58% 相似待验证工程实践中建议将路由器层、注意力投影矩阵及门控网络保留在 BF16/FP16 精度,仅对专家 FFN 权重进行激进量化57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/896505API
curl https://kongchang.com/api/v1/knowledge/claims/896505MCP
get_claim(id=896505)