Midjourney V8.2编辑功能实测|谷歌视频续写模型与Anthropic物理AI新动态

Midjourney V8.2:从生成到编辑的关键一步
长期以来,Midjourney凭借出色的艺术感在AI图像生成领域占据一席之地,但在图像编辑能力上始终是短板——用户很难对已生成的画面进行精细化调整。随着Midjourney V8.2图像编辑模型的推出,这块拼图终于开始补齐。
新版本的核心变化在于引入了对话式改图能力:用户可以直接向模型提出修改要求,模型便能理解并执行。对话式改图(Conversational Image Editing)是近两年多模态大模型发展的重要方向之一,其技术基础在于将大语言模型(LLM)的自然语言理解能力与图像扩散模型(Diffusion Model)的生成能力相结合,使模型能够解析用户的文字修改指令,并精准地映射到图像像素层面的变换。此前,Adobe Firefly、OpenAI的GPT-4o以及Google的Gemini都在探索类似路径。这种能力的核心难点在于"局部编辑的可控性"——模型需要准确理解用户希望修改的区域和程度,同时保持画面其余部分不变,这对模型的空间理解和语义定位能力提出了很高要求。
据B站UP主实测,目前支持的操作已经相当丰富,包括更换画风、修改画面角度、多图融合以及丰富画面元素等常见需求。

不过需要客观看待的是,该功能目前仍处于早期阶段,稳定性有待提升。在实际测试中,改图结果并不总是符合预期。但考虑到Midjourney本身在出图质感上的深厚积累,一旦编辑能力成熟,其"生成+编辑"的完整工作流将极具竞争力。这也是许多创作者对其保持期待的原因。
图像编辑能力为何重要
对于专业创作者而言,一次生成很难满足所有需求,反复重绘不仅浪费算力,也难以保证画面的连贯性。具备编辑能力意味着用户可以在同一张基础图上迭代打磨,这才是真正符合创作逻辑的工作方式。
在Midjourney之前,AI图像编辑领域已有多种技术路线并存。Inpainting(局部重绘)是最早被广泛使用的方案,用户手动框选区域后由模型重新填充内容;Instruct-Pix2Pix则尝试通过文字指令直接编辑图像,无需手动标注区域。Stability AI的StableDiffusion社区通过ControlNet等插件实现了姿态、深度等条件控制。然而这些方案要么需要较高的技术门槛,要么在编辑精度和画面一致性上存在不足。Midjourney选择在其原生平台内集成对话式编辑,目标显然是降低使用门槛,让非技术用户也能完成精细化的图像迭代。
Midjourney补上这一环,标志着它从"抽卡式生成工具"向"可控创作平台"迈进。
谷歌Gemini Omni 1.1 Flash:AI视频续写的新解法
在AI视频生成赛道,谷歌发布的Gemini Omni 1.1 Flash带来了一个颇具亮点的能力——视频自然延长。它的核心"绝活"是:给定一段视频,模型能够读取前面约10秒的画面内容,并续写出后续情节。

视频续写(Video Continuation/Extrapolation)是AI视频生成中公认的高难度任务。与单帧图像生成不同,视频需要在时间维度上保持严格的一致性,包括角色外观、运动轨迹、物理规律和场景光照等多个层面。早期的视频生成模型(如Runway Gen-2、Pika等)在生成3-5秒短片时就常常出现角色变形、物理失真等问题,更不用说基于已有视频进行连贯续写。Gemini Omni 1.1 Flash能读取约10秒前文视频并保持续写一致性,背后依赖的是对视频时序信息的深度建模能力,以及多模态Transformer架构在长序列理解上的突破。
更值得关注的是续写过程中的一致性表现。据实测,角色样貌、光照条件、环境氛围乃至整体故事基调都能得到相对稳定的保持。这解决了此前AI视频生成中"续写即崩坏"的普遍痛点。官方还给出了与SD2.5的对比效果——SD2.5指的可能是Stability AI旗下的Stable Video Diffusion系列模型,该模型在开源社区有广泛应用但在长视频一致性上仍有明显局限——展示了Gemini在生成质量上的明显优势。
双模式设计:兼顾效率与质量
Gemini Omni 1.1 Flash在工作流设计上考虑得较为周到,提供了草稿快速调试与专业出片两种模式:
- 草稿模式:在前期打磨创意阶段,可使用360P低分辨率快速生成预览,大幅缩短反馈周期;
- 专业模式:当创意确定后,可将画质提升至4K,输出成品级内容。

这种分层渲染策略在影视和游戏行业的CG制作中早已是标准流程。例如皮克斯在制作动画电影时,前期会用低精度渲染(Playblast)快速预览镜头构图和角色动画,确认创意方向后再投入高精度渲染(Final Render),后者的单帧渲染时间可能是前者的数百倍。Gemini Omni将这一成熟思路引入AI视频生成领域,360P草稿模式本质上是用较少的计算资源快速验证创意可行性,避免用户在4K高质量生成上浪费大量GPU算力和等待时间。这种设计对于降低AI视频创作的试错成本具有重要意义,尤其适合需要频繁迭代的广告、短视频和概念预演等场景。
此外,模型还支持导入简短的参考视频来引导生成方向,让AI更精准地产出用户期望的画面风格。这种"低成本试错、高质量交付"的分层设计,显然是针对真实创作场景做的优化。

Anthropic布局物理AI:MHS硬件标准解析
除了图像与视频领域的进展,Anthropic也传出踏入物理AI新赛道的消息,发布了名为MHS(Model Hardware Standard)的模型硬件标准。简单来说,这是一套统一接口协议,用于让AI智能体对接工业等各类物理设备。
MHS可以类比为物理设备领域的"MCP协议"(Model Context Protocol)。MCP是Anthropic此前推出的用于连接AI模型与软件工具的开放协议,而MHS则将这一理念从数字工具扩展到了物理硬件。在工业自动化领域,设备通信一直依赖OPC-UA、MQTT、Modbus等多种异构协议,不同厂商的设备往往需要定制化的集成方案。MHS试图在这些底层协议之上建立一个AI原生的抽象层,让大语言模型能够以统一的方式理解设备能力(如传感器量程、执行器精度)、下发控制指令并获取反馈。这与ROS(Robot Operating System)在机器人领域的角色有相似之处,但MHS更强调与大模型智能体的原生集成,而非传统的程序化控制。
其价值在于打通了AI与硬件之间的沟通壁垒:AI能够识别每台设备的功能能力,向其下发指令,甚至同时调度多台仪器协同工作。这意味着大模型的能力开始从数字世界向物理世界延伸,为工业自动化、智能制造等场景提供了新的想象空间。
从数字智能到物理智能
如果说图像和视频生成是AI在"感知与创作"层面的能力扩展,那么MHS标准则代表着AI向"行动与执行"层面的渗透。一个统一的设备接口标准,长远看有可能成为智能体调度物理世界的基础设施,其战略意义不容小觑。
值得注意的是,Anthropic并非唯一布局物理AI的科技巨头。NVIDIA早在2024年就大力推广其"Physical AI"战略,通过Isaac平台和Omniverse数字孪生技术为机器人和自动化系统提供AI训练和仿真环境。Google DeepMind则通过RT系列(Robotics Transformer)模型探索大模型直接控制机器人的可能性。OpenAI也曾投资人形机器人公司Figure AI。Anthropic选择从标准协议层面切入,走的是"基础设施"路线——与其直接开发机器人,不如先定义AI与硬件之间的通信规范。如果这一标准被广泛采纳,Anthropic将在物理AI生态中占据关键的"连接层"位置,这一布局的深远影响值得持续关注。
小结
三则动态勾勒出AI技术演进的三条清晰路径:Midjourney V8.2补齐图像编辑短板,走向可控创作;谷歌Gemini Omni 1.1 Flash以视频续写和双模式设计提升AI视频生成的实用性;Anthropic的MHS标准则试图打通AI与物理设备的连接。从图像到视频再到硬件,AI正在多个维度加速落地。
核心要点
相关推荐

前Meta员工爆料:高薪工程师竟在给AI做数据标注
前Meta员工曝光大厂AI化转型真相:百万年薪工程师被安排做RLHF数据标注,组织扁平化后员工只需向AI系统汇报,咨询医疗等行业也在被AI重塑。知识工作者如何应对自我替代的职业困境?

自然语言驱动Blender:用AI编程助手生成3D场景实战
通过ChatGPT Codex等AI编程助手调用Blender Python API,仅用几句自然语言指令即可生成精美3D场景。本文详解从安装到渲染的完整流程,探讨编程助手作为通用执行器的创作新范式。

CAPI-DINO:为自监督学习补上全局表征的组合式探索
CAPI-DINO实验将DINO全局目标叠加到CAPI局部表征之上,在ViT-B/14模型上实现68.7%线性探测准确率,仅消耗16%算力。本文详解其架构设计、实验结果及局部与全局表征的权衡。