Qwen Image 2.1
阿里巴巴通义团队推出的开源图像生成模型,支持文生图和图像编辑能力,面向ComfyUI等本地部署场景
核心事实
时间轴 (近 90 天)
Reddit 社区出现了一个基于 Qwen Image 2.1 的换脸 LoRA 模型,作者将其命名为 bestfaceswap(简称 bfs)
按照阿里的开源协议,Qwen Image 2.1 当前公开授权仅限非商业的研究和评估用途,商业项目需另外申请商业许可
在漫画和影视分镜场景中,Qwen Image 2.1 存在细节崩坏问题,GPT 在分镜逻辑、台词归属和表情表现上领先较多
在多图换衣服场景中,Qwen Image 2.1 可直接迁移穿在人物身上的衣服,一致性、质感、细节保持良好,原图基本无变形
在人物资料卡等文字密集场景中,Qwen Image 2.1 布局清晰、小字可辨,是上一代 2511 完全无法胜任的场景
官方推荐采样 40–50 步,25 步也能正常出图,但 40 步以上在细节与质感上明显更好
配置不高的用户建议使用 INT8 量化模型并严格控制参考图数量,否则大概率爆显存
在 RTX 5090D 上跑满血全 BF16 模型,单图编辑 50 步 2K 分辨率约需一分半,三参考图则飙到八分钟
Qwen Image 2.1 本地部署 8GB 显存可以跑,但分辨率和参考图数量会受限,其中参考图数量对显存的压力最大
Qwen Image 2.1 尚不能替代 GPT 或 Nano Banana 这类闭源图像编辑产品,细节问题较多且对提示词依赖极高
还有 40 条时间轴事件
全部知识事实 (20)
Qwen-Image-Edit是阿里巴巴通义千问团队推出的图像编辑模型,具备图像生成和局部编辑能力
90%已验证Qwen Image是阿里推出的文生图模型
90%已验证测试者提到 Qwen Image 2.1 的图像编辑和参考图能力看起来不错
70%已验证阿里通义千问系列的图像生成模型 Qwen Image 2.1 已开放早期访问权限
70%部分验证借助 Qwen Image 2.1 的图像编辑工作流,换脸过程可以简化到两张图加一段提示词,无需任何遮罩操作
80%待验证已安装 ComfyUI 的用户通常只需更新到支持该模型的版本并下载对应模型权重文件即可通过节点加载使用 Qwen-Image-2.1
60%待验证Qwen Image 2.1 是一款仅有 70 亿(7B)参数规模的图像生成模型
60%待验证社区评论者认为 Qwen Image 2.1 只需在某一个维度(如编辑能力)胜出即有存在价值,否则只是又一个文生图竞品
60%待验证图像编辑模块支持人脸替换等操作,可保持与参考图一致的效果
60%待验证在 RTX 5090D 上跑满血全 BF16 模型,单图编辑 50 步 2K 分辨率约需一分半,三参考图则飙到八分钟
50%待验证Qwen Image 2.1 本地部署 8GB 显存可以跑,但分辨率和参考图数量会受限,其中参考图数量对显存的压力最大
50%待验证官方发布的资源包括两个底模(BF16 与 INT8 量化版)、三个文本模型(BF16、INT8、FP8)、一个 BF16 的 VAE,以及两个分别支持图片编辑和文生图的 PE 模型
50%待验证Qwen Image 2.1 尚不能替代 GPT 或 Nano Banana 这类闭源图像编辑产品,细节问题较多且对提示词依赖极高
50%待验证按照阿里的开源协议,Qwen Image 2.1 当前公开授权仅限非商业的研究和评估用途,商业项目需另外申请商业许可
50%待验证在漫画和影视分镜场景中,Qwen Image 2.1 存在细节崩坏问题,GPT 在分镜逻辑、台词归属和表情表现上领先较多
50%待验证在多图换衣服场景中,Qwen Image 2.1 可直接迁移穿在人物身上的衣服,一致性、质感、细节保持良好,原图基本无变形
50%待验证在人物资料卡等文字密集场景中,Qwen Image 2.1 布局清晰、小字可辨,是上一代 2511 完全无法胜任的场景
50%待验证官方推荐采样 40–50 步,25 步也能正常出图,但 40 步以上在细节与质感上明显更好
50%待验证配置不高的用户建议使用 INT8 量化模型并严格控制参考图数量,否则大概率爆显存
50%待验证UP主认为Qwen Image 2.1本地方案在生成速度上不逊色于豆包等付费云端服务
50%