待验证50% 置信发布精确时间
已有Mamba-2及与Transformer混合的架构(如Jamba)问世,将注意力机制与SSM层交替叠加
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证当前纯SSM架构在语言建模质量上仍与Transformer存在差距,业界更多探索Mamba-Transformer混合架构(如Jamba)77% 相似待验证Hymba是NVIDIA于2024年提出的混合头注意力架构,在同一层内同时部署SSM头和注意力头,通过可学习门控机制融合输出,在1.5B参数规模下超越同规模纯Transformer和纯SSM模型70% 相似待验证vLLM除支持Transformer架构外,还在优化Mamba等新兴架构的性能63% 相似待验证Megatron-LM最早系统化提出了针对Transformer的张量并行方案,将注意力头和FFN层分别切分到不同设备61% 相似待验证在Transformer架构中,每个层由多头自注意力机制和多层感知机(MLP)两个核心子模块组成60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/913182API
curl https://kongchang.com/api/v1/knowledge/claims/913182MCP
get_claim(id=913182)