[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Qwen3稀疏注意力 / Qwen Sparse Attention
QSA
Qwen3-Next模型采用的稀疏注意力变体,通过C4块(每4个相邻Token组成一个计算单元)在块级别进行注意力选择,并设有12个独立维护选择策略的吸收层,以降低长序列推理的计算量
来源文章
双卡RTX4090跑通Qwen3-Next:8并发满血长上下文实测
9月15日