转载:https://zhuanlan.zhihu.com/p/2067950644137403735
前言 🔖
最近 MiniMax-H3 很火,但很多人打开生成页面以后,还是会卡在同一个地方,提示词到底应该怎么写?
明明脑子里已经有画面了,真正输入时却只能写出:
一个女孩走在街上,电影感,高质量,画面精美。
最后生成的视频不是动作不对,就是镜头乱跑,甚至人物、场景和声音都与想象中不一样。问题不一定出在模型上,而是我们仍在用“写图片提示词”的思路写视频。图片只需要描述一个静止画面,视频却需要交代:
- 一开始是什么画面
- 人物接下来做什么
- 镜头怎么移动
- 画面如何发生变化
- 最后停在哪里
- 视频中出现什么声音
这篇文章不讲复杂参数,直接用新手能看懂的方式,把 MiniMax-H3 的三类提示词一次讲清楚:
- 文生视频
- 图生视频与首尾帧生视频
- 全能参考生视频
文章最后还准备了一套完整指令。即使你完全不会写提示词,也可以把自己的简单想法交给 AI,让 AI 帮你整理成 MiniMax-H3 提示词。
一、MiniMax-H3 有什么不同?🔖
MiniMax-H3 是一个通用多模态视频模型,可以统一理解文字、图片、视频和音频,并根据不同素材生成带有声音的视频。
主要提供三类生成方式:
| 生成方式 | 需要提供什么 | 适合场景 |
|---|---|---|
| 文生视频 | 文字提示词 | 从零创作场景和故事 |
| 图生视频、首尾帧 | 一张或两张图片 + 提示词 | 让图片动起来,控制开始和结束画面 |
| 全能参考生视频 | 图片、视频、音频 + 提示词 | 参考人物、产品、动作、镜头、声音或风格 |
MiniMax-H3 支持4—15秒视频、多种常见画面比例、最高2K输出,并且可以原生生成立体声音。全能参考模式最多可以输入9张图片、3段视频和3段音频,混合素材总数不超过12个。
不过,对普通用户来说,暂时不用记住这些复杂规格。
只需要先记住一句话:
MiniMax-H3 提示词不是关键词清单,而是一份简短的视频拍摄说明。
二、一个好用的视频提示词应该写什么?🔖
最简单的 MiniMax-H3 提示词,可以使用下面这个公式:
主体+场景+动作过程+镜头运动+画面变化+声音
例如,我们先写一个非常普通的提示词:
一名女孩在雨夜街道上奔跑,电影感。
这句话虽然没有错,但模型并不知道:
- 女孩穿什么衣服
- 她为什么奔跑
- 摄像机在哪里
- 奔跑过程中发生什么
- 雨声、脚步声是否出现
- 视频最后停在哪里
稍微完善以后,可以改成:
8秒写实电影风视频。雨夜的城市街道上,一名穿黑色风衣的年轻女孩从远处快速跑向镜头,路面布满积水,霓虹灯倒映在水面上。镜头低机位向后平稳跟拍,女孩跑过水坑时溅起水花。第6秒,她突然停下并回头望向身后,镜头缓慢推近她紧张的面部。环境中有持续的雨声、急促的脚步声和轻微喘息声,无背景音乐。
两段提示词表达的是同一个想法,但第二段明显更像一个真正的视频。
三、文生视频提示词怎么写?🔖
文生视频不需要上传任何素材,人物、场景、动作和镜头都由模型根据文字创建。它比较适合:
- 创意短片
- 广告镜头
- 风景视频
- 动画片段
- 电影感画面
- 无固定角色的故事场景
🔹 3.1 文生视频通用结构
可以按照下面的顺序写:
视频时长和风格+开场画面+主体外观+动作过程+镜头运动+结束画面+声音
例如:
10秒,16:9,写实电影广告风格。清晨,一辆银灰色越野车停在被薄雾笼罩的山路上,车身表面凝结着细小水珠。镜头从车头灯的特写开始,缓慢向后拉远,展示完整车身和周围的高山森林。第4秒,车辆启动并沿着弯曲山路向前行驶,镜头切换为低机位侧面跟拍,车轮压过潮湿路面,带起少量水雾。最后两秒,镜头升高,展示车辆驶向远处山谷的全景。声音包括发动机低沉启动声、轮胎摩擦湿润路面的声音和清晨微弱的风声,搭配节奏缓慢、逐渐增强的低音弦乐。
这个提示词主要交代了六件事:
- 视频风格
- 主体是什么
- 主体在哪里
- 主体做什么
- 镜头怎么拍
- 视频里有什么声音
🔹 3.2 动作较多时,加入时间线
当视频中不止一个动作时,最好使用时间分段。
例如:
12秒,复古胶片风格。
0—3秒:一名年轻男生坐在老式火车靠窗位置,低头查看手中的旧照片,镜头保持中景,窗外景色快速后退。
3—7秒:男生慢慢抬头望向窗外,镜头从侧面缓慢推近,玻璃上出现他的倒影。
7—10秒:画面切换到照片特写,一滴眼泪落在照片表面。
10—12秒:镜头重新回到男生面部,他轻轻闭上眼睛,画面逐渐变暗。
全程保留火车行驶的低频震动声、车轮与铁轨碰撞声。背景音乐使用缓慢、稀疏的钢琴声,结尾逐渐减弱。
官方提示词指南也建议:当视频包含多个情节节点时,可以通过镜头编号或时间节点描述视频过程,从而让动作和节奏更加清楚。
🔹 3.3 文生视频最常见的错误
- 只写画面,不写动作
错误写法:模型只知道画面中有什么,却不知道视频应该怎样发展。
一个女孩站在海边,唯美电影感。
可以改成:
女孩背对镜头站在海边,海风吹动她的白色长裙和头发。她慢慢转身看向镜头,然后抬手遮挡迎面吹来的风。
- 一个短视频塞进太多剧情
8秒视频里同时安排奔跑、打斗、爆炸、转场、变装和对白,模型很难全部完成。
实际创作时,建议一个短视频围绕一个核心动作展开。复杂故事可以拆成几个镜头分别生成,再进行剪辑。
- 同时使用互相冲突的镜头
例如:
镜头静止,同时快速环绕人物并不断推进。
“镜头静止”和“快速环绕”是冲突的。每个镜头最好只安排一个主要运镜。
四、图生视频和首尾帧提示词怎么写?🔖
图生视频的重点不是重新描述图片,而是告诉模型:
从这张图片开始,接下来发生什么。
首尾帧生视频则需要告诉模型:
怎样从第一张图片,自然地变化到第二张图片。
🔹 4.1 单图生视频
只上传一张图片时,这张图片一般作为视频的开场画面。
提示词可以使用下面的结构:
保留图片中的人物和构图+人物开始做什么+环境如何变化+镜头如何移动+最后达到什么状态
例如,上传一张女孩站在花田中的图片:
以图1作为视频首帧,完整保留女孩的面部特征、白色连衣裙、站立位置、花田环境和原有光线。视频开始后,微风逐渐吹动女孩的头发、裙摆和周围花朵。女孩先低头看向手中的花,随后慢慢抬头,对着镜头露出自然的微笑。镜头以很小的幅度缓慢向前推进,全程保持人物身份、服装和背景稳定。环境中有轻柔风声、花叶摩擦声和远处鸟鸣声,无对白。
这里最重要的是两点:
- 哪些内容必须保留
- 图片中的静止状态怎样开始运动
官方指南建议,单图生视频应该先锚定参考图中的人物、服装、颜色、物体和空间关系,再描述接下来连续发生的动作。
🔹 4.2 首尾帧生视频
上传两张图片时,通常是:
- 图1:视频开始画面
- 图2:视频结束画面
这时不要只描述两张图片分别是什么,而要描述两张图片之间的变化过程。
例如:图1是一把关闭的雨伞,图2是一把完全打开的雨伞。
提示词可以写成:
图1作为视频0秒的首帧,图2作为视频8秒的尾帧。使用一个连续镜头完成整个变化过程。开始时,人物保持图1中的站姿、服装、雨伞位置和街道构图。人物右手握紧伞柄,左手推动伞骨滑环,黑色雨伞从收拢状态逐渐展开。伞面打开过程中,雨水沿着黑色布料向四周滑落,人物向前移动半步,并将伞柄调整到图2中的角度。镜头缓慢小幅后拉,最终准确落在图2的人物姿势、雨伞状态、画面构图和光线效果上。全程有连续雨声、伞骨展开的金属摩擦声和伞面弹开的轻微声响,无背景音乐。
首尾帧模式最重要的不是开头和结尾,而是中间的“运动路径”。
官方提示词指南建议优先使用连续单镜头,并明确人物姿势、物体状态、构图和光线如何逐渐靠近尾帧,避免只重复描述两张静止图片。
🔹 4.3 首尾帧常见错误
- 错误一:首尾帧差异过大
- 例如首帧是室内人物,尾帧突然变成太空飞船,模型需要同时完成人物变化、场景变化和镜头变化,稳定性容易降低。
- 错误二:没有说明变化过程
- 只写:从图1变成图2。
- 模型只能自己猜测中间发生了什么。
- 错误三:要求尾帧绝对静止太久
- 首尾帧之间如果没有足够的动作路径,视频中间可能出现停顿、动作突然加速或最后强行对齐的问题。
五、全能参考生视频提示词怎么写?🔖
全能参考是 MiniMax-H3 最有意思的一类能力。
你可以同时提供:
- 人物参考图片
- 产品参考图片
- 场景参考图片
- 动作参考视频
- 运镜参考视频
- 音色参考音频
- 音乐或节奏参考
但素材越多,越不能只上传以后什么都不说。
全能参考模式最重要的原则是:
明确告诉模型,每一个素材分别用来参考什么。
MiniMax 官方展示的示例中,可以让模型参考一段视频的希区柯克式运镜、另一张图片中的人物,以及一段音频中的声音。官方强调,需要通过自然语言说明不同参考素材和目标视频之间的关系。
🔹 5.1 全能参考提示词结构
可以使用下面的格式:
图1负责什么
图2负责什么
视频1负责什么
音频1负责什么
最终视频要生成什么
时间线和镜头如何发展
哪些内容必须保持一致
例如:
图1用于参考女主角的面部特征、发型、身材和服装,生成过程中保持人物身份一致。
图2用于参考银色耳机产品的外观、颜色、材质、按键结构和品牌标志,不得改变产品设计。
视频1仅用于参考镜头环绕人物的运动方式和节奏,不参考视频中的人物、场景和服装。
音频1用于参考女主角的声音音色、语速和自然停顿,不复用音频中的原始台词。
生成一段10秒、16:9的科技产品广告。画面位于简洁的银白色未来空间中。女主角佩戴图2中的银色耳机站在画面中央,保持图1中的人物外观和服装。
0—3秒:镜头从女主角侧后方开始,参考视频1的环绕方式,缓慢移动到人物正面,耳机表面出现柔和高光。
3—7秒:女主角抬起右手轻触耳机侧面按键,周围出现细小的声波粒子效果。她使用音频1的音色和语速说:“戴上它,听见属于自己的世界。”
7—10秒:镜头继续缓慢靠近耳机产品,人物轻轻闭上眼睛,背景空间逐渐变暗,耳机轮廓保持清晰。
保持人物身份、耳机结构和品牌标志稳定。声音包括轻微按键声、空间环境声和低频电子音乐,人物口型与台词自然同步。
相比“参考这些素材生成一个广告”,这种写法最大的区别是:
每个参考素材都有明确任务。
官方完整参考模式还会进一步区分人物、图片、视频和音频的作用,并说明它们是需要完整保留、部分保留、属性迁移,还是只参考风格或节奏。
六、多个参考素材应该怎样分工?🔖
可以直接参考下面这张表:
| 素材 | 可以参考的内容 | 提示词写法 |
|---|---|---|
| 人物图片 | 面部、发型、服装、身份 | 图 1 用于参考人物外观和服装 |
| 产品图片 | 结构、材质、颜色、Logo | 图 2 用于参考产品外观,不得改变结构 |
| 场景图片 | 建筑、背景、光线、构图 | 图 3 用于参考场景和整体光线 |
| 动作视频 | 人物动作、姿势、节奏 | 视频 1 仅参考人物动作 |
| 运镜视频 | 推拉、环绕、跟拍、转场 | 视频 2 仅参考镜头运动 |
| 风格视频 | 色调、剪辑、画面质感 | 视频 3 参考整体影像风格 |
| 人声音频 | 音色、语速、情绪 | 音频 1 参考人物声音,不复用台词 |
| 音乐音频 | 节奏、配器、音乐风格 | 音频 2 参考音乐节奏和配器 |
不要只写:
参考图1、图2和视频1。
而应该写:
图1参考人物,图2参考产品,视频1只参考动作,不参考其中的人物和背景。
这一点往往比增加更多形容词更重要。
七、MiniMax-H3 提示词的6个实用技巧 🔖
🔹 7.1 先写动作,再补风格
先确定人物做什么、镜头怎么走,再补充电影感、广告感或动画风格。
不要一开始就堆满:
电影感、大师级、震撼、极致、顶级、超高质量。
这些词不能代替具体画面。
🔹 7.2 使用可以被看见的动作
模糊表达:
女孩感到悲伤。
具体表达:
女孩低下头,握紧手中的照片,眼眶逐渐湿润。
模型更容易理解可以直接呈现在画面中的行为。
🔹 7.3 每个镜头只安排一个主要运镜
例如:
- 缓慢推近
- 向右平移
- 环绕人物
- 跟随人物移动
- 保持固定镜头
不要在一个短镜头里同时要求快速推近、拉远、旋转和升高。
🔹 7.4 多个动作使用时间线
只有一个简单动作时,可以自然描述。
动作较多时,使用:
0—3秒
3—6秒
6—10秒
这样更容易控制节奏。
🔹 7.5 不要忽略声音
MiniMax-H3 可以同时生成视频和声音,因此提示词中可以写:
- 环境声
- 动作音效
- 人物对白
- 人物呼吸或笑声
- 背景音乐
- 音乐的速度和乐器
官方提示词结构会分别描述整体环境与动作声音,以及只有观众能够听到的背景音乐。
🔹 7.6 明确哪些内容不能改变
使用参考素材时,可以增加:
保持人物面部、服装和身份一致。
保持产品外形、颜色、材质和Logo稳定。
不参考视频中的人物,只参考镜头运动。
不复用参考音频的原台词,只参考音色。
八、三类提示词的万能模板 🔖
🔹 8.1 文生视频模板
【时长、比例和风格】
在【时间和场景】中,【主体外观与位置】。
0—X秒:【主体动作+镜头运动】。
X—X秒:【画面变化+主体动作+镜头运动】。
X—X秒:【结束动作+最终画面】。
声音包括【环境声】【动作音效】【对白】。背景音乐使用【乐器、速度和节奏】。
保持【人物、物体或场景的一致性要求】。
🔹 8.2 图生视频模板
以图1作为视频首帧,保留图中的【人物、服装、物体、构图、场景和光线】。
视频开始后,【主体从静止状态开始做什么】,随后【动作如何连续发展】。镜头使用【运镜方式】,最终停在【结束状态】。
声音包括【环境声和动作音效】。
保持【人物身份、产品结构或场景】稳定。
🔹 8.3 首尾帧模板
图1作为视频0秒首帧,图2作为视频X秒尾帧。
开始时保持图1中的【人物状态和构图】。主体先【第一个动作】,接着【中间变化】,最后【逐渐接近尾帧的动作】。镜头使用【单一连续运镜】,最终准确落在图2中的【姿势、物体状态、构图和光线】。
全程保持【人物、服装、物体和场景】一致。声音包括【环境声、动作声音和音乐】。
🔹 8.4 全能参考模板
图1用于参考【人物、产品、场景或风格】。
图2用于参考【具体内容】。
视频1仅用于参考【动作、运镜、节奏或剪辑】,不参考【排除内容】。
音频1用于参考【音色、音乐、节奏或声音】,不复用【排除内容】。
生成一段【时长、比例和风格】视频。
0—X秒:【镜头和动作】。
X—X秒:【镜头和动作】。
X—X秒:【结尾画面】。
保持【必须一致的内容】,不得改变【产品结构、人物身份、Logo或文字】。
声音包括【环境声、音效、对白和背景音乐】。
九、不会写提示词?让 AI 帮你写 🔖
很多人看完模板还是会觉得麻烦。
其实没有必要自己一个字一个字组合。
你只需要告诉 AI:
一个女孩在雨夜逃跑,最后回头看,想要电影感。
然后让 AI 根据固定规则,自动补充人物、动作、镜头、时间线和声音。
下面这套指令可以直接复制使用。
MiniMax-H3 视频提示词生成指令(精简版)
你是一名专业的AI视频导演和MiniMax-H3提示词设计师。
你的任务是将用户简单、混乱或不完整的视频想法,整理成清晰、可执行、适合MiniMax-H3的视频生成提示词。
MiniMax-H3主要包含三种生成模式:
1.文生视频:只使用文字生成视频。
2.图生视频或首尾帧生视频:使用一张首帧图片,或者首帧和尾帧两张图片。
3.全能参考生视频:使用人物、产品、场景、风格图片,以及动作、运镜、剪辑视频或音频作为参考。
请先根据用户提供的素材自动判断生成模式。
模式判断规则:
-没有上传任何素材:文生视频。
-上传一张作为视频开始或结束画面的图片:图生视频。
-上传首帧和尾帧两张图片:首尾帧生视频。
-上传图片、视频或音频用于参考人物、产品、场景、动作、镜头、风格或声音:全能参考生视频。
-首尾帧素材与全能参考素材不要混淆。
提示词编写规则:
1.使用自然、清楚、具体的语言,不要堆砌空洞关键词。
2.明确视频时长、画面比例和整体风格。
3.描述主体的外观、位置、动作和状态变化。
4.描述动作从开始到结束的连续过程。
5.动作超过一个时,使用时间段划分,例如0—3秒、3—6秒。
6.每个镜头只安排一个主要运镜。
7.镜头运动必须与人物动作和画面变化配合。
8.可以使用推近、拉远、平移、跟拍、环绕、升降、固定镜头等运镜。
9.描述环境声、动作音效、人物对白和背景音乐。
10.对白必须保持用户原文,不得自行修改。
11.使用参考素材时,必须明确每个素材的具体作用。
12.不得笼统地写“参考所有素材”。
13.明确哪些内容需要完整保留,哪些内容只参考风格、动作、运镜或声音。
14.如果参考视频只用于动作或运镜,明确说明不参考其中的人物、服装和场景。
15.图生视频需要从参考图的静止状态自然向前发展。
16.首尾帧生视频需要重点描述首帧到尾帧之间的动作路径,优先使用连续单镜头。
17.不得凭空增加用户没有要求的重要人物、产品、文字、Logo或剧情。
18.避免安排无法在指定时长内完成的复杂剧情。
19.保持人物身份、服装、产品结构、Logo和重要场景的一致性。
20.输出内容使用中文;人物对白、歌词和画面文字保持用户指定语言。
输出格式:
一、生成模式
说明判断出的生成模式。
二、素材分工
没有参考素材时写“无”。
有参考素材时,逐一说明每张图片、每段视频和每段音频负责什么。
三、提示词设计思路
用简短要点说明主体、动作、镜头、声音和结尾设计。
四、最终提示词
输出一份可以直接复制使用的完整MiniMax-H3提示词,不要在提示词中加入解释。
五、精简版提示词
在不改变核心内容的情况下,输出一份更短的版本。
用户输入信息:
生成想法:
【填写想生成的视频】
视频时长:
【例如8秒、10秒或15秒】
画面比例:
【例如16:9、9:16、1:1】
整体风格:
【选填】
参考图片:
【说明每张图片的内容;没有则填写无】
参考视频:
【说明每段视频想参考什么;没有则填写无】
参考音频:
【说明想参考音色、音乐、节奏或声音;没有则填写无】
人物对白:
【没有则填写无】
必须保留:
【人物、产品、Logo、文字等】
禁止出现:
【选填】
其他要求:
【选填】
十、最后总结 🔖
MiniMax-H3 提示词其实没有想象中那么复杂。
文生视频主要解决:
要生成什么,以及这个画面怎样动起来。
图生视频和首尾帧主要解决:
怎样从已有画面自然发展到下一个状态。
全能参考生视频主要解决:
每份参考素材分别提供什么,以及哪些内容必须保持一致。
真正影响视频效果的,通常不是提示词写得有多华丽,而是你有没有说清楚:
- 谁出现在画面中
- 他在哪里
- 他做什么
- 动作怎样发展
- 镜头怎样拍
- 最后停在哪里
- 视频中听到什么
- 参考素材分别负责什么
不会写也没有关系。
先把自己的想法用最简单的话说出来,再交给 AI 整理成完整提示词,就已经足够开始创作了。