待验证50% 置信事实精确时间
MiniMax M3采用MSA(Multi-head Shared Attention,多头共享注意力)架构,通过在多个注意力头之间共享部分KV缓存来降低长序列推理时的内存占用和计算成本
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
5大模型Coding实战横评:Claude、GPT、DeepSeek、M3谁是工程利器
bilibili不正经的前端啊2026/6/8
相关事实
待验证DeepSeek V4的DSA(吸收注意力/Differential Sparse Attention)机制在百万上下文场景下,计算量降至V3.2的27%,KV缓存降至10%65% 相似待验证num_ctx 参数直接影响内存占用,KV缓存需要为每个上下文token存储注意力计算的中间状态62% 相似已验证多头潜在注意力机制(MLA)通过将KV投影到低维潜在空间压缩存储,将KV Cache显存占用降低至传统方法的5%至13%62% 相似待验证MLA(Multi-head Latent Attention)通过低秩压缩将 KV 缓存的显存占用降低至传统 MHA 的约 1/859% 相似待验证Mavis将记忆分为全局记忆、智能体记忆和会话记忆三个层级59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/48722API
curl https://kongchang.com/api/v1/knowledge/claims/48722MCP
get_claim(id=48722)