Sora
OpenAI推出的AI视频生成工具,采用视频扩散Transformer架构,能够理解物理世界的运动规律生成高质量视频
核心事实
时间轴 (近 90 天)
静态视觉素材可用Midjourney、Seedream或Flux生成,动态视频片段可交给Runway、Kling或Sora生成
Sora、Runway、可灵是文本/图像转视频模型的代表
OpenAI 的文本推理能力来自 GPT 系列,代码能力来自 Codex 衍生能力,视频能力来自 Sora
主流T2V模型包括Runway Gen系列、Sora、Kling、Wan等
早期的 Sora 或 Runway 等 AI 视频工具以像素级视频作为最终输出,生成后难以局部修改
Sora 和 Runway 属于基于文本提示从零生成视频的工具
Runway、Pika、Sora等生成式AI工具专为影视创作设计并降低了技术门槛
主流文生视频模型(包括Seedance、Kling、Sora等)均基于扩散Transformer架构,每次生成为独立随机采样,相同提示词两次生成结果存在显著差异
MiniMax H3与Runway Gen系列、Sora、可灵同属原生视频大模型技术赛道
传统视频生成模型采用离线批量生成模式,生成后无法修改,需等待一两分钟输出短片
还有 40 条时间轴事件
全部知识事实 (20)
OpenAI的Sora采用扩散Transformer架构,以高质量文生视频著称
90%已验证FLUX采用了DiT(Diffusion Transformer)架构,用纯Transformer替代了传统的U-Net结构
80%已验证Sora采用DiT(Diffusion Transformer)架构,将视频压缩为时空patch序列后输入Transformer,以Transformer替代传统U-Net作为去噪骨干网络
80%已验证静态图像转化为动态视频(Image-to-Video)的代表性技术包括Runway Gen系列、Kling(可灵)、Sora等
75%已验证扩散模型成为Stable Diffusion、DALL-E 3等主流工具的底层架构
70%已验证AI视频工具市场正在形成通用AI视频工具与垂直AI工具两条路线之争
70%已验证Sora采用了Diffusion Transformer(DiT)架构,将Transformer全局注意力机制引入扩散框架
65%已验证每生成一段10秒的高质量AI视频,所消耗的GPU计算资源可能是生成一张图片的数十倍
65%待验证2023年后,以Stable Video Diffusion、Sora为代表的时序扩散模型开始将视频理解为时空连续体,能够在潜空间中同时建模多帧之间的运动关系
85%待验证Mira Murati主导了GPT-4、DALL-E、Sora等多个旗舰产品的研发落地
85%待验证Seedance 2.0属于视频扩散模型(Video Diffusion Model),底层原理与Stable Diffusion、Sora等模型类似
80%待验证AI对创作工具的改造路径是先文本(ChatGPT),再图像(Midjourney、Stable Diffusion、DALL-E),再向音频和视频延伸
80%待验证OpenAI Sora基于Diffusion Transformer架构,在视觉质量上取得突破但仍频繁出现液体无故消失、刚体穿透等物理幻觉
80%待验证即梦视频生成插件采用了类似Sora的视频大模型架构,在图像扩散模型基础上增加了时间维度的一致性约束
70%部分验证万象(Wan)视频生成模型基于 DiT(Diffusion Transformer)架构
65%待验证2024年初OpenAI展示的Sora模型能够生成长达一分钟的高清视频
60%待验证当前AI视频生成工具如OpenAI的Sora、Runway的Gen-2、Pika Labs能根据文本生成数秒到数分钟的连贯视频
60%待验证Sora能够生成长达一分钟的高质量视频
60%待验证生成式AI目前已覆盖文本、图像、音频、视频等几乎所有媒介形态,包括GPT-4、Claude、Midjourney、DALL-E、Stable Diffusion、Sora、Runway、Kling等工具
60%待验证当前AI视频生成赛道主要玩家包括 Runway(Gen系列)、Pika 等公司
60%