[控场AI]
模型Qwen3 Next

Qwen3-Next

阿里巴巴Qwen3系列的新一代大语言模型,采用QSA(稀疏注意力)机制,支持超长上下文处理,通过选择性关注部分Token降低长序列计算量

时间轴 (近 90 天)

9月15日

该项目用两张显存各48GB的RTX 4090,跑完8条接近256K的长上下文请求

待验证50%
9月15日

该项目把类似HiSparse的KV卸载思路移植到QSA(Qwen3-Next使用的稀疏注意力结构),让完整历史留在主机内存,显存只保留热数据

待验证50%
9月15日

编码任务实测中模型实现Python流式响应解析器,14项自测一次通过,真实任务总用时约49.94秒,独立复跑14项测试加4项额外检查全部通过

待验证50%

全部知识事实 (3)

来源文章