Qwen
Qwen(通义千问)是阿里巴巴集团研发并开源的大语言模型系列,支持文本生成、对话、代码编写、多语言理解等多种自然语言处理任务。该系列涵盖不同参数规模的基础模型与对话微调版本,具备较强的中英文双语能力,可供研究人员和开发者进行下游任务微调与部署应用。
核心事实
时间轴 (近 90 天)
Llama系列使用SentencePiece BPE分词,Qwen系列使用基于字节级BPE的自定义分词器
Rebiha目前支持Qwen、Gemma、Phi、DeepSeek、Llama和Mistral等主流开源模型
在Qwen模型发布前三个月,llama.cpp项目改变了推测标志的拼写方式,旧拼写仍被接受但被悄悄忽略,导致推测停止运行
DeepSeek、Qwen、GLM三家都在旗舰之外单独推出高速轻量的Flash版,且Flash版下载量普遍更高
阿里的Qwen、DeepSeek、01.AI的Yi等中国团队的开源模型在全球开源生态中扮演重要角色
Qwen团队在发布权重时就训练好了MTP头,MTP头已包含在模型文件中
Unsloth支持Llama、Mistral、Qwen、Gemma等主流架构,并提供跨平台支持,涵盖NVIDIA、AMD显卡及Apple Silicon
2023年起Meta的Llama系列、阿里的Qwen系列、Mistral AI的Mistral系列等开源模型快速发展,参数规模从70亿到700亿不等
如果训练集中代码数据占比达到40-50%(如Qwen的策略),模型会在编程任务中表现卓越,但可能在日常对话中显得过于技术化
Qwen(通义千问)是阿里巴巴达摩院开发的大语言模型系列,以其在代码生成和数学推理方面的强悍能力而闻名
还有 40 条时间轴事件
全部知识事实 (20)
GPT-4和Mixtral等主流大模型也采用了MoE架构
85%已验证Meta于2023年发布LLaMA系列模型,随后Mistral、Qwen、DeepSeek等相继跟进形成开源生态
70%已验证Qwen(通义千问)是阿里巴巴开源的模型,在中文任务上表现优异
70%已验证Meta开源了Llama系列模型,阿里开源了Qwen系列,Mistral AI也采用开源策略
70%已验证当前开源大模型领域形成多极竞争格局,包括Meta的Llama、阿里巴巴的Qwen、Mistral AI和DeepSeek
65%已验证Qwen系列在架构层面引入了GQA(分组查询注意力)机制,相比标准多头注意力降低了KV缓存的内存占用
65%已验证Qwen系列采用Apache 2.0协议开放,允许商业使用和二次修改
65%已验证Meta的Llama 3系列、Mistral、Qwen、DeepSeek等模型在多项基准测试上已接近甚至超越早期的GPT-4水平,且支持本地部署
65%已验证Qwen 3.5架构使用改进的Transformer变体,融合了分组查询注意力(GQA)和旋转位置编码(RoPE)等技术
65%已验证Qwen是阿里巴巴达摩院开发的大语言模型系列,于2023年首次发布
65%待验证开源AI大模型阵营以Meta(Llama系列)、DeepSeek、Mistral、阿里(Qwen)等为代表
90%待验证千问(Qwen)和DeepSeek都提供了基于MOE架构的版本
90%待验证Open-source models such as Llama, Qwen, and DeepSeek have further compressed deployment costs
85%待验证Qwen系列模型已开源多个版本(Qwen-7B到Qwen-72B),在多项国际基准测试中表现优异
80%待验证千问(Qwen)系列模型在爱马仕Agent中基本正常运行
80%待验证2024-2025年间Llama 3、Qwen 2.5等开源模型在多项基准测试中已接近甚至匹敌闭源商业模型
75%待验证Llama系列使用SentencePiece BPE分词,Qwen系列使用基于字节级BPE的自定义分词器
50%待验证Rebiha目前支持Qwen、Gemma、Phi、DeepSeek、Llama和Mistral等主流开源模型
50%待验证DeepSeek、Qwen、GLM三家都在旗舰之外单独推出高速轻量的Flash版,且Flash版下载量普遍更高
50%待验证阿里的Qwen、DeepSeek、01.AI的Yi等中国团队的开源模型在全球开源生态中扮演重要角色
50%