Unverified50% confidenceFactExact time
Muse Glimmer采用混合注意力机制:大部分层只关注2048 token的局部窗口,每隔四层做一次全局全注意力
1
Sources
50%
Confidence
Long-term
Relevance
8/23/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedMuse Glimmer是稠密模型,每次推理激活全部300亿参数,Flash Attention可将速度提升约1.5到3倍77% similarUnverifiedMuse Glimmer在实测中视觉能力表现亮眼,高级识图和发票识别均获满分,视觉能力已不输千问71% similarUnverifiedSliding Window Attention 被 Mistral 等模型采用,将每个 token 的注意力范围限制在固定窗口内70% similarUnverified多头注意力在不同的低维子空间中并行执行多次注意力操作,通常8头或16头68% similarUnverifiedQwen3.5-Omni采用混合注意力MOE(Mixture of Experts)架构66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/789147API
curl https://kongchang.com/api/v1/knowledge/claims/789147MCP
get_claim(id=789147)