Wan
阿里巴巴通义实验室开源的视频生成基础模型,基于Diffusion Transformer(DiT)架构构建,将视频帧划分为16×16像素时空Patch进行处理
时间轴 (近 90 天)
主流T2V模型包括Runway Gen系列、Sora、Kling、Wan等
社区评论认为 Qwen 团队和 Wan 团队在真实数据集质量方面存在不足
主流的开源视频模型如CogVideoX、Wan在相机控制上普遍存在响应不精确的问题
加速LoRA技术已被广泛应用于Wan、HunyuanVideo等主流开源视频模型的本地部署加速
与 Wan、CogVideoX 等同期模型相比,MiniMax 模型的参数规模较大,本地部署对硬件要求偏高
主流可本地部署视频生成模型包括字节跳动的 CogVideoX、快手的 Wan,商业 API 方面有 Runway、Pika、Kling 等
该创作者仍保留此前用 Wan 视频生成积累的一批 LoRA,认为其中一些无法替代
Wan团队开源了角色动画模型Wan-Animate-2
使用ti2v-5b Q5模型在960x544分辨率、81帧、20步设置下,每步仅耗时1.95秒,并剩余约3GB显存空闲
阿里巴巴通义团队发布的Wan系列曾一度是开源视频生成的主流选择
全部知识事实 (10)
主流T2V模型包括Runway Gen系列、Sora、Kling、Wan等
50%待验证社区评论认为 Qwen 团队和 Wan 团队在真实数据集质量方面存在不足
50%待验证主流的开源视频模型如CogVideoX、Wan在相机控制上普遍存在响应不精确的问题
50%待验证加速LoRA技术已被广泛应用于Wan、HunyuanVideo等主流开源视频模型的本地部署加速
50%待验证与 Wan、CogVideoX 等同期模型相比,MiniMax 模型的参数规模较大,本地部署对硬件要求偏高
50%待验证主流可本地部署视频生成模型包括字节跳动的 CogVideoX、快手的 Wan,商业 API 方面有 Runway、Pika、Kling 等
50%待验证该创作者仍保留此前用 Wan 视频生成积累的一批 LoRA,认为其中一些无法替代
50%待验证使用ti2v-5b Q5模型在960x544分辨率、81帧、20步设置下,每步仅耗时1.95秒,并剩余约3GB显存空闲
50%待验证阿里巴巴通义团队发布的Wan系列曾一度是开源视频生成的主流选择
50%待验证Wan团队开源了角色动画模型Wan-Animate-2
50%