Qwen
Qwen(通义千问)是阿里巴巴集团研发并开源的大语言模型系列,支持文本生成、对话、代码编写、多语言理解等多种自然语言处理任务。该系列涵盖不同参数规模的基础模型与对话微调版本,具备较强的中英文双语能力,可供研究人员和开发者进行下游任务微调与部署应用。
Core Facts
Timeline (last 90 days)
在图像分类任务中,OpenAI 约 3.4 秒完成,本地运行 Qwen flash 的 Ollama 方案约 9.5 秒(运行于 Dell Pro Max/GB10 DGX Spark 设备上)
LRCC在Llama和Qwen系列模型上进行了语言建模和零样本下游任务的评估
Jeff模型是Bespoke Labs自研的决策专用模型系列,参数量从0.8B到1.4B,Nimble系列基于Qwen底座微调
RoPE被LLaMA、Qwen、Mistral等主流模型广泛采用,并衍生出YaRN、LongRoPE等长度外推变体
在GSM8K数学推理任务上,Qwen模型适应能保持答案格式合规性,但精确匹配保留效果在0.6B规模受随机种子影响混杂,在1.7B规模甚至有所恶化
发帖者认为如果循环架构能在工业规模稳定工作,DeepSeek、Qwen、GLM 等开源模型团队或许会开始实验这类架构
Claude Code可通过API Key替换方式接入国内模型(如DeepSeek、Qwen)以降低成本,但会牺牲一定模型能力上限
这些工具大幅降低了在消费级GPU甚至CPU上运行开源模型(如Llama、Mistral、Qwen等)的技术门槛
9B 级别的小模型在长链条、多步骤的自主任务执行上,受限于上下文窗口的有效利用率和多步推理稳定性,容易出现目标漂移
该开发者通过 LM Studio 在本地运行 Qwen 模型,并搭配 opencode 作为客户端
40 more timeline events
All Facts (20)
Meta的Llama 3系列、Mistral、Qwen、DeepSeek等模型在多项基准测试上已接近甚至超越早期的GPT-4水平,且支持本地部署
90%VerifiedGPT-4和Mixtral等主流大模型也采用了MoE架构
85%VerifiedQwen(通义千问)是阿里巴巴达摩院开源的系列大模型,覆盖从0.5B到72B的多种参数规模,支持多语言和多模态任务
80%Verified千问(Qwen)系列是阿里云通义实验室开发的开源大语言模型家族
80%VerifiedOllama是一个轻量级跨平台工具,专门用于本地大模型的部署和运行,支持Llama 3.1、Qwen2等开源模型
80%VerifiedQwen的图像生成能力基于扩散模型(Diffusion Model)技术
80%VerifiedQwen在中英双语乃至多语言场景下表现突出,源于预训练语料中包含大量高质量中文文本
75%VerifiedQwen、Mixtral、DeepSeek等开源大模型系列均采用MoE设计
75%VerifiedQwen(通义千问)是阿里巴巴开源的模型,在中文任务上表现优异
75%VerifiedMeta开源了Llama系列模型,阿里开源了Qwen系列,Mistral AI也采用开源策略
75%VerifiedMeta的Llama系列、DeepSeek-R1、Mistral等主流开源模型大多属于开放权重模型
70%VerifiedMeta于2023年发布LLaMA系列模型,随后Mistral、Qwen、DeepSeek等相继跟进形成开源生态
70%VerifiedQwen(通义千问)由阿里云推出
70%VerifiedQwen是阿里通义千问系列的多模态版本,在中英双语理解和视觉任务上表现稳健
65%VerifiedQwen(通义千问)是阿里开源的多语言模型
65%VerifiedQwen(通义千问)是阿里巴巴推出的大模型系列
65%Verified开源方案允许用户灵活切换底层模型,包括本地部署的开源模型如 Llama、Qwen 等
65%Verified当前开源大模型领域形成多极竞争格局,包括Meta的Llama、阿里巴巴的Qwen、Mistral AI和DeepSeek
65%VerifiedMoE架构在推理时仅激活一小部分专家子网络,2.4T参数模型每次推理可能仅激活约200-400亿参数
65%VerifiedDeepSeek此前的R1模型在技术报告中描述了从自研模型蒸馏至小参数版本的流程
65%