Qwen3
阿里巴巴推出的第五代千问大模型系列,全球首款开源混合推理模型,共六个尺寸,支持Dense和MoE双架构,旗舰模型235B-A22B可与Gemini 2.5 Pro正面抗衡
Core Facts
Timeline (last 90 days)
Mixtral、DeepSeek、Qwen3 等开源模型都采用了 MoE 架构
研究团队在单一语言内部对比了七款基于BPE的分词器:GPT-2、GPT-4、gpt-oss、Llama 3.1、Gemma 3、Qwen3和Kimi K2
研究者在SMDM和Qwen3等模型上针对新事实和自然指令进行了验证,CAGD改善遗忘的方向性结论依然成立
8并发方案适用于企业内部团队共享写代码、隐私数据本地处理、搭建自有Agent Harness三类场景
整套8并发演示运行在'懒猫微服AI'平台上,单机即可承载8路Qwen3 Flash Next的并发推理
一台英伟达设备可以同时开启8个终端并运行8个独立的Agent任务,使用Qwen3(Flash Next)模型,每个任务相互独立互不干扰
该模型权重总量约116G,其中60多G必须塞进显存,其余部分被卸载到SSD
B站UP主「仿宝剪蛮」让AMD 395(搭载8060S核显)在Windows系统上运行Qwen3系列的Flash-Next大模型
使用 AMD Radeon RX 7900XTX 在 Windows 11 上通过 Strata 跑 Qwen3,生成速度(输出 token)稳定在 60-80 t/s,平均约 68 token/s
7900XTX 在 Windows 下 Qwen3 IQ3_XSS 量化的 Prompt 处理(preview)速度只有约 400-479 t/s
40 more timeline events
All Facts (20)
Qwen2.5:7B模型Q4量化后文件大小约为4GB
80%VerifiedQwen(通义千问)是阿里巴巴达摩院开源的系列大模型,覆盖从0.5B到72B的多种参数规模,支持多语言和多模态任务
80%VerifiedQwen3引入了思考模式与非思考模式的动态切换机制
80%Verified在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒
70%VerifiedQwen3系列编程模型约20GB加载,推理时可膨胀到35-40GB
70%VerifiedQwen3是阿里云于2025年发布的新一代开源大模型系列,支持混合推理模式
70%VerifiedQwen3.8-27B采用Apache 2.0授权,完全免费商用,没有额外的商业使用限制
65%Verified300B INT4量化模型约需150-180GB存储空间
65%VerifiedMoE 模型每次推理仅激活总参数量的一小部分,Qwen3 Max 每次推理激活量可能为总量的1/8至1/16
65%VerifiedQwen系列采用Apache 2.0协议开放,允许商业使用和二次修改
65%VerifiedQwen3-4B在多项推理类评测指标上已与DeepSeek V3或GPT-4o相差无几
65%Verified千问3(Qwen3)旗舰版参数量高达235B、体积约142GB
65%VerifiedQwen3可以通过Ollama在本地部署运行
65%VerifiedQwen 2.5系列在2024年推出,覆盖0.5B至72B的全系列开源权重
70%UnverifiedRL训练中模型能够识别自己是否处于模拟环境中并据此改变行为,即奖励欺骗现象
90%UnverifiedGemma 4引入了多模态能力,Qwen3支持超长上下文,DeepSeek采用MoE(混合专家)架构
85%UnverifiedQwen3 8B版本在工具调用(Function Calling)基准测试中表现突出
70%UnverifiedLlama 3、Qwen2/3等主流开源模型均已采用GQA
60%UnverifiedQwen3.5-4B是一个仅有40亿参数的小型模型,由阿里巴巴通义千问团队推出
60%UnverifiedQwen3系列原生支持MTP
60%