待验证50% 置信事实精确时间
LLaMA-2 70B 模型共有 80 个 Transformer 层,每层包含自注意力机制和前馈神经网络两大模块
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
待验证Llama-3 70B采用80层Transformer、每层64个注意力头、每头128维配置,并采用GQA设计73% 相似待验证LLaMA-2 70B采用80层、64个注意力头的架构,并使用GQA(8个KV头共享64个Q头)69% 相似待验证Megatron-LM最早系统化提出了针对Transformer的张量并行方案,将注意力头和FFN层分别切分到不同设备67% 相似待验证DiT(Diffusion Transformer)架构的参数量已达数十亿级别,单次推理的中间激活值在高分辨率下可占满80GB A100的全部显存64% 相似待验证The Transformer architecture uses a Self-Attention mechanism to achieve efficient parallel processing of sequential data, replacing RNN/LSTM architectures.63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/563109API
curl https://kongchang.com/api/v1/knowledge/claims/563109MCP
get_claim(id=563109)