模型Qwen3 Next
Qwen3-Next
阿里巴巴Qwen3系列的新一代大语言模型,采用QSA(稀疏注意力)机制,支持超长上下文处理,通过选择性关注部分Token降低长序列计算量
时间轴 (近 90 天)
9月15日
该项目用两张显存各48GB的RTX 4090,跑完8条接近256K的长上下文请求
待验证50%
9月15日
该项目把类似HiSparse的KV卸载思路移植到QSA(Qwen3-Next使用的稀疏注意力结构),让完整历史留在主机内存,显存只保留热数据
待验证50%
9月15日
编码任务实测中模型实现Python流式响应解析器,14项自测一次通过,真实任务总用时约49.94秒,独立复跑14项测试加4项额外检查全部通过
待验证50%