MiniMax H3提示词怎么写?一个Skill搞定

MiniMax H3 视频模型开源已有一段时间,但很多用户依然被一个基础问题卡住:提示词到底该怎么写? 官方虽然给出了提示词规范,但文档结构相对复杂,对新手并不友好。B站UP主艾克针对这一痛点,将官方规则整理成了一个专门面向 H3 的提示词 Skill(ProMate),并通过大量 A/B 实测验证了其效果。本文基于其分享,梳理 H3 提示词的核心逻辑与实战方法。
视频提示词不是写作文,而是写「拍摄说明书」
很多人第一次用视频模型时,会很自然地写出一段「大白话」剧情。比如这样一个场景:清晨两个人在合租房客厅讨论一件奇怪的事,男生拿出手机确认女生身份,却发现手机里的联系人、聊天记录、照片全是另一个人的,两人最后震惊地看着对方,末尾再补一句「真人电影感、人物保持一致、不要字幕」。
这样的提示词其实已经把剧情讲得很清楚,H3 也确实能生成——剧情大致对,人物也知道该在什么时候说话。但问题在于:镜头怎么切、先拍谁、人物站在哪、哪句话用什么景别,这些信息统统没有告诉模型,于是模型只能「自己发挥」。

这里的核心矛盾在于视频生成与文本生成之间的范式差异。传统的文本生成AI接收自然语言指令即可输出连贯文本,但视频生成模型面临的挑战完全不同。视频是一种多维度信息的同步呈现——它同时包含空间构图、时间序列、运动轨迹、光影变化和音频层。当用户只提供叙事性描述时,模型需要在这些维度上独立做出数百个微决策:摄像机放在哪里?焦距多少?人物之间的空间距离如何?每个动作持续几帧?这些决策在专业影视制作中由导演、摄影指导和剪辑师协同完成,而视频模型在缺乏明确指令时只能依赖训练数据中的统计规律进行推断,结果往往呈现为「能看但不够好」的中庸状态。
UP主的核心观点很有启发性:视频模型的提示词,本质上不是在写作文,而更像是在写一份给导演、摄影师和演员看的拍摄说明书。你需要告诉模型的,不是「发生了什么」,而是「这件事应该怎么拍」。
H3提示词的六大核心要素
看似复杂的 MiniMax 提示词,其实可以拆解成六个部分:人物、场景、动作、镜头、时间轴、声音。

这里有必要补充一下 MiniMax H3 模型的背景。MiniMax 是一家专注于多模态大模型的中国 AI 公司,其视频生成模型 H3(也称为 Hailuo AI Video)在开源社区引起了广泛关注。H3 支持文本到视频(T2V)和图像到视频(I2V)两种生成模式,能够生成具有较高画质和动态一致性的短视频片段。与 Runway Gen-3、Pika、可灵等同类模型相比,H3 的一个显著特点是其提示词系统支持更精细的时间轴控制和多模态声音描述,这意味着用户可以对生成结果进行更细粒度的干预,但也相应提高了提示词编写的复杂度。
人物与场景:先定「谁」和「在哪」
如果有参考图,就要明确告诉模型图一是谁、图二是谁,谁长什么样、穿什么衣服,五官和发型必须保持一致。场景部分则不能只写「在客厅」或「在教室」,最好补上人物站位——比如女生站在客厅中央,男生站在沙发旁边。因为如果你不写,模型就只能自己安排空间关系,结果往往不可控。
动作与镜头:告诉模型「怎么拍」
同样一句「男生拿出手机」,你可以只这么写,也可以进一步拆解:先给男生近景,他停顿一下拿出手机低头查看,然后切到女生近景,她开始紧张。剧情完全没变,但模型突然「知道该怎么拍了」。这正是从大白话到专业提示词的关键跨越。
理解这一跨越需要了解景别与镜头语言的基础知识。景别是影视制作中最基础的视觉语法之一,它定义了摄像机与拍摄对象之间的距离关系。常用景别从远到近依次为:远景(展示环境全貌)、全景(展示人物全身与环境关系)、中景(膝盖以上)、近景(胸部以上,常用于对话场景)、特写(面部或物体细节)和大特写(眼睛、手指等极端局部)。不同景别传递不同的情感强度——远景常用于建立场景氛围,特写则强化情绪张力。在传统影视制作中,景别的选择是导演和摄影指导在分镜阶段就确定的核心决策。当视频模型缺乏景别指令时,它倾向于使用中景这一「安全」选择,导致画面缺乏视觉节奏变化。
时间轴:像分镜脚本一样逐秒拆解
时间轴是 H3 特别好用的一个功能。你可以直接规定:0 到 2.5 秒拍什么,2.5 到 5 秒拍什么,5 到 7 秒再切哪个镜头。这样一段 10 秒左右的视频,就能像分镜脚本一样被逐秒拆开,甚至可以精确规定每一秒发生什么。
分镜脚本(Storyboard)是影视工业中的标准预生产工具,由导演或分镜画师将剧本逐镜头拆解为包含构图草图、镜头运动、持续时间和转场方式的详细说明。好莱坞大片通常会为每部电影绘制数千张分镜图。H3 模型支持的时间轴控制本质上是将这一工业流程数字化——用户可以以秒为单位精确定义每个时间段内的画面内容、镜头运动和声音事件。这种精细控制能力在当前主流视频生成模型中并不普遍,它使 H3 特别适合需要精确叙事节奏的短片创作,但也要求用户具备一定的影视分镜思维。
声音:容易被忽略但至关重要的一环
如果视频里有人说话,就要写清楚是谁说、说什么、什么语气;还可以补充环境音,如脚步声、手机提示音、翻擦声等,甚至可以明确要求「不要背景音乐」。

概括起来,一条完整的 H3 提示词本质上就是回答:谁、在哪里、做什么、镜头怎么看、什么时候发声、听到什么。
A/B实测:同一剧情,两种拍法
为了验证提示词结构的价值,UP主做了一组对照实验,两条视频使用完全相同的剧情,唯一区别在于提示词的写法。
- 第一条(大白话版): 直接把大白话剧情丢给 H3。结果剧情基本对,但镜头调度全靠模型猜测。
- 第二条(结构化版): 把同样的剧情丢进 ProMate Skill,自动整理成人物参考、人物站位、分镜时间轴、景别、人物动作、对白、声音以及各种一致性限制,再交给 H3 生成。
结果第二条视频在镜头语言、人物一致性和叙事节奏上明显更专业。UP主强调,重点并不是提示词「字多」,而是它把原本需要模型自己猜的东西提前告诉了模型。这也印证了一个核心原则:尽量少让模型猜。
这个原则背后有其深层逻辑。视频生成模型在推理阶段本质上是在一个极高维度的概率空间中采样——当约束条件少时,可能的输出空间极为庞大,模型只能选择统计意义上最「常见」的结果,这往往意味着平庸。而当用户提供精确的景别、时间轴和空间位置等约束时,相当于大幅缩小了搜索空间,模型能够将计算资源集中在生成更高质量的细节上,而非浪费在「猜」基本构图上。
ProMate Skill的三大功能
虽然规则本身不难,但每次上传视频前都手写这么长的提示词确实繁琐,这正是 UP主开发这个 Skill 的初衷。它主要提供三种能力:
Skill 在这里指的是一种预封装的提示词工程模板或自动化工具,它将特定领域的专业知识(如影视镜头语言规则)编码为可复用的指令框架。这反映了 AI 应用领域的一个重要趋势:随着模型能力的增强,高质量输出的瓶颈正从模型本身转向用户的指令质量。Prompt Engineering(提示词工程)已经从一种个人技巧演变为一个系统化的工程问题。类似的工具化尝试还包括 Midjourney 的 Style Reference、ComfyUI 的工作流模板等。这类工具的核心价值在于将专业知识平民化——用户不需要懂电影学院的镜头语法,只需要有创意想法,工具负责将想法转译为模型能精确执行的技术指令。
功能一:一句话生成 T2V 提示词
完全不会写也没关系。比如只告诉它「一个女生晚上在便利店偶遇前男友,两个人都假装不认识」,Skill 就会自动补齐人物、场景、站位、动作、镜头、时间轴和声音,生成一条完整的 H3 提示词。
功能二:跨模型格式转换
如果你已经有提示词——无论是从网上复制的,还是为即梦等其他视频模型写的——不需要重写,直接丢进去让它「改成 MiniMax H3 的格式」,它会保留原有内容和创意,再按 H3 结构重新组织。这一功能解决了当前视频生成领域的一个现实痛点:不同模型对提示词的格式偏好差异显著。例如 Runway Gen-3 更偏好自然语言风格的描述,可灵对镜头运动有自己的关键词体系,而 H3 则倾向于结构化的分镜式指令。跨模型迁移提示词时,简单复制粘贴往往效果不佳,需要针对目标模型的特性进行「翻译」。
功能三:参考视频拆分还原
这也是UP主认为最实用的功能:如果你连提示词都没有,只是刷到一条喜欢的视频,直接把视频扔进去,Skill 会先拆解每个镜头的景别、运镜方式、人物动作、切换时机和动作时长,再重新组织成 H3 格式的提示词。

这一功能本质上是对视频进行逆向工程——从成品反推生产参数。在影视行业中,类似的工作被称为「镜头分析」或「影片拉片」,是电影学院学生的必修训练。学生需要逐帧分析经典影片的景别选择、运镜轨迹、剪辑节奏和声音设计,从中学习导演的视觉叙事手法。Skill 将这一需要多年训练才能掌握的分析能力自动化,让普通用户也能从喜欢的视频中提取可复用的「拍摄配方」。
你负责想,Skill负责翻译
UP主特别提醒:真正有用的从来不是把提示词写得越长越好,而是该告诉模型的尽量告诉它,无关的废话反而应该删掉。所谓「论文级提示词」只是玩笑,核心目的始终只有一个——少让模型猜。
对于刚上手 H3 的用户,不必先背一堆提示词公式,只需记住一句话:你负责想拍什么,Skill 负责把它翻译成 H3 听得懂的拍摄语言。该 Skill 已开源,感兴趣的用户可自行获取体验。对于视频创作者而言,这类工具的价值在于把专业的镜头语言门槛降到最低,让创意得以更完整地落地。从更宏观的视角看,这也代表了 AI 创作工具发展的一个重要方向:模型能力与用户意图之间的「翻译层」正变得越来越重要,未来可能会出现更多针对特定模型、特定创作场景的专业化 Skill,形成一个围绕提示词工程的工具生态。
核心要点
相关推荐

Claude Code入门指南:终端AI编程工具安装与选型全解析
详解Claude Code终端AI编程工具的核心特点、安装配置方法,对比终端Agent与设备Agent两大方向,推荐Claude Code搭配DeepSeek的实用组合方案,帮助开发者快速上手AI编程。

没有博士学位,AI研发岗存在隐形天花板吗?
没有博士学位能否在AI研发岗走到底?本文从顶级研究实验室到工业界产品团队,分析硕士工程师在计算机视觉等AI领域的职业天花板、IC技术专家路线、破局策略,以及是否值得读博的成本收益判断。

地球上最长直线路径:32089公里不碰陆地是怎么算出来的
地球上最长的直线路径有多长?从巴基斯坦到堪察加半岛的32089公里海上直线,以及从连云港到里斯本的11241公里陆地直线,背后是大圆路径与分支定界算法的精妙结合。