AI

MiniMax-H3 提示词完整教程:文生视频、首尾帧、全能参考,附 AI 代写指令(推荐)

转载:https://zhuanlan.zhihu.com/p/2067950644137403735

前言 🔖


最近 MiniMax-H3 很火,但很多人打开生成页面以后,还是会卡在同一个地方,提示词到底应该怎么写?

明明脑子里已经有画面了,真正输入时却只能写出:

一个女孩走在街上,电影感,高质量,画面精美。

最后生成的视频不是动作不对,就是镜头乱跑,甚至人物、场景和声音都与想象中不一样。问题不一定出在模型上,而是我们仍在用“写图片提示词”的思路写视频。图片只需要描述一个静止画面,视频却需要交代:

  • 一开始是什么画面
  • 人物接下来做什么
  • 镜头怎么移动
  • 画面如何发生变化
  • 最后停在哪里
  • 视频中出现什么声音

这篇文章不讲复杂参数,直接用新手能看懂的方式,把 MiniMax-H3 的三类提示词一次讲清楚:

  • 文生视频
  • 图生视频与首尾帧生视频
  • 全能参考生视频

文章最后还准备了一套完整指令。即使你完全不会写提示词,也可以把自己的简单想法交给 AI,让 AI 帮你整理成 MiniMax-H3 提示词。

  

一、MiniMax-H3 有什么不同?🔖


MiniMax-H3 是一个通用多模态视频模型,可以统一理解文字、图片、视频和音频,并根据不同素材生成带有声音的视频。

主要提供三类生成方式:

生成方式需要提供什么适合场景
文生视频文字提示词从零创作场景和故事
图生视频、首尾帧一张或两张图片 + 提示词让图片动起来,控制开始和结束画面
全能参考生视频图片、视频、音频 + 提示词参考人物、产品、动作、镜头、声音或风格

  

MiniMax-H3 支持4—15秒视频、多种常见画面比例、最高2K输出,并且可以原生生成立体声音。全能参考模式最多可以输入9张图片、3段视频和3段音频,混合素材总数不超过12个。

不过,对普通用户来说,暂时不用记住这些复杂规格。

只需要先记住一句话:

MiniMax-H3 提示词不是关键词清单,而是一份简短的视频拍摄说明。

  

二、一个好用的视频提示词应该写什么?🔖


最简单的 MiniMax-H3 提示词,可以使用下面这个公式:

主体+场景+动作过程+镜头运动+画面变化+声音

例如,我们先写一个非常普通的提示词:

一名女孩在雨夜街道上奔跑,电影感。

这句话虽然没有错,但模型并不知道:

  • 女孩穿什么衣服
  • 她为什么奔跑
  • 摄像机在哪里
  • 奔跑过程中发生什么
  • 雨声、脚步声是否出现
  • 视频最后停在哪里

稍微完善以后,可以改成:

8秒写实电影风视频。雨夜的城市街道上,一名穿黑色风衣的年轻女孩从远处快速跑向镜头,路面布满积水,霓虹灯倒映在水面上。镜头低机位向后平稳跟拍,女孩跑过水坑时溅起水花。第6秒,她突然停下并回头望向身后,镜头缓慢推近她紧张的面部。环境中有持续的雨声、急促的脚步声和轻微喘息声,无背景音乐。

两段提示词表达的是同一个想法,但第二段明显更像一个真正的视频。

  

三、文生视频提示词怎么写?🔖


文生视频不需要上传任何素材,人物、场景、动作和镜头都由模型根据文字创建。它比较适合:

  • 创意短片
  • 广告镜头
  • 风景视频
  • 动画片段
  • 电影感画面
  • 无固定角色的故事场景

  

🔹 3.1 文生视频通用结构

可以按照下面的顺序写:

视频时长和风格+开场画面+主体外观+动作过程+镜头运动+结束画面+声音

例如:

10秒,16:9,写实电影广告风格。清晨,一辆银灰色越野车停在被薄雾笼罩的山路上,车身表面凝结着细小水珠。镜头从车头灯的特写开始,缓慢向后拉远,展示完整车身和周围的高山森林。第4秒,车辆启动并沿着弯曲山路向前行驶,镜头切换为低机位侧面跟拍,车轮压过潮湿路面,带起少量水雾。最后两秒,镜头升高,展示车辆驶向远处山谷的全景。声音包括发动机低沉启动声、轮胎摩擦湿润路面的声音和清晨微弱的风声,搭配节奏缓慢、逐渐增强的低音弦乐。

这个提示词主要交代了六件事:

  • 视频风格
  • 主体是什么
  • 主体在哪里
  • 主体做什么
  • 镜头怎么拍
  • 视频里有什么声音

  

🔹 3.2 动作较多时,加入时间线

当视频中不止一个动作时,最好使用时间分段。

例如:

12秒,复古胶片风格。

0—3秒:一名年轻男生坐在老式火车靠窗位置,低头查看手中的旧照片,镜头保持中景,窗外景色快速后退。

3—7秒:男生慢慢抬头望向窗外,镜头从侧面缓慢推近,玻璃上出现他的倒影。

7—10秒:画面切换到照片特写,一滴眼泪落在照片表面。

10—12秒:镜头重新回到男生面部,他轻轻闭上眼睛,画面逐渐变暗。

全程保留火车行驶的低频震动声、车轮与铁轨碰撞声。背景音乐使用缓慢、稀疏的钢琴声,结尾逐渐减弱。

官方提示词指南也建议:当视频包含多个情节节点时,可以通过镜头编号或时间节点描述视频过程,从而让动作和节奏更加清楚。

  

🔹 3.3 文生视频最常见的错误

  • 只写画面,不写动作

错误写法:模型只知道画面中有什么,却不知道视频应该怎样发展。

一个女孩站在海边,唯美电影感。

可以改成:

女孩背对镜头站在海边,海风吹动她的白色长裙和头发。她慢慢转身看向镜头,然后抬手遮挡迎面吹来的风。
  • 一个短视频塞进太多剧情

8秒视频里同时安排奔跑、打斗、爆炸、转场、变装和对白,模型很难全部完成。

实际创作时,建议一个短视频围绕一个核心动作展开。复杂故事可以拆成几个镜头分别生成,再进行剪辑。

  • 同时使用互相冲突的镜头

例如:

镜头静止,同时快速环绕人物并不断推进。

“镜头静止”和“快速环绕”是冲突的。每个镜头最好只安排一个主要运镜。

  

四、图生视频和首尾帧提示词怎么写?🔖


图生视频的重点不是重新描述图片,而是告诉模型:

从这张图片开始,接下来发生什么。

首尾帧生视频则需要告诉模型:

怎样从第一张图片,自然地变化到第二张图片。

🔹 4.1 单图生视频

只上传一张图片时,这张图片一般作为视频的开场画面。

提示词可以使用下面的结构:

保留图片中的人物和构图+人物开始做什么+环境如何变化+镜头如何移动+最后达到什么状态

例如,上传一张女孩站在花田中的图片:

以图1作为视频首帧,完整保留女孩的面部特征、白色连衣裙、站立位置、花田环境和原有光线。视频开始后,微风逐渐吹动女孩的头发、裙摆和周围花朵。女孩先低头看向手中的花,随后慢慢抬头,对着镜头露出自然的微笑。镜头以很小的幅度缓慢向前推进,全程保持人物身份、服装和背景稳定。环境中有轻柔风声、花叶摩擦声和远处鸟鸣声,无对白。

这里最重要的是两点:

  • 哪些内容必须保留
  • 图片中的静止状态怎样开始运动

官方指南建议,单图生视频应该先锚定参考图中的人物、服装、颜色、物体和空间关系,再描述接下来连续发生的动作。

  

🔹 4.2 首尾帧生视频

上传两张图片时,通常是:

  • 图1:视频开始画面
  • 图2:视频结束画面

这时不要只描述两张图片分别是什么,而要描述两张图片之间的变化过程。

例如:图1是一把关闭的雨伞,图2是一把完全打开的雨伞。

提示词可以写成:

图1作为视频0秒的首帧,图2作为视频8秒的尾帧。使用一个连续镜头完成整个变化过程。开始时,人物保持图1中的站姿、服装、雨伞位置和街道构图。人物右手握紧伞柄,左手推动伞骨滑环,黑色雨伞从收拢状态逐渐展开。伞面打开过程中,雨水沿着黑色布料向四周滑落,人物向前移动半步,并将伞柄调整到图2中的角度。镜头缓慢小幅后拉,最终准确落在图2的人物姿势、雨伞状态、画面构图和光线效果上。全程有连续雨声、伞骨展开的金属摩擦声和伞面弹开的轻微声响,无背景音乐。

首尾帧模式最重要的不是开头和结尾,而是中间的“运动路径”。

官方提示词指南建议优先使用连续单镜头,并明确人物姿势、物体状态、构图和光线如何逐渐靠近尾帧,避免只重复描述两张静止图片。

  

🔹 4.3 首尾帧常见错误

  • 错误一:首尾帧差异过大
    • 例如首帧是室内人物,尾帧突然变成太空飞船,模型需要同时完成人物变化、场景变化和镜头变化,稳定性容易降低。
  • 错误二:没有说明变化过程
    • 只写:从图1变成图2。
    • 模型只能自己猜测中间发生了什么。
  • 错误三:要求尾帧绝对静止太久
    • 首尾帧之间如果没有足够的动作路径,视频中间可能出现停顿、动作突然加速或最后强行对齐的问题。

  

五、全能参考生视频提示词怎么写?🔖


全能参考是 MiniMax-H3 最有意思的一类能力。

你可以同时提供:

  • 人物参考图片
  • 产品参考图片
  • 场景参考图片
  • 动作参考视频
  • 运镜参考视频
  • 音色参考音频
  • 音乐或节奏参考

但素材越多,越不能只上传以后什么都不说。

全能参考模式最重要的原则是:

明确告诉模型,每一个素材分别用来参考什么。

MiniMax 官方展示的示例中,可以让模型参考一段视频的希区柯克式运镜、另一张图片中的人物,以及一段音频中的声音。官方强调,需要通过自然语言说明不同参考素材和目标视频之间的关系。

  

🔹 5.1 全能参考提示词结构

可以使用下面的格式:

图1负责什么
图2负责什么
视频1负责什么
音频1负责什么
最终视频要生成什么
时间线和镜头如何发展
哪些内容必须保持一致

例如:

图1用于参考女主角的面部特征、发型、身材和服装,生成过程中保持人物身份一致。

图2用于参考银色耳机产品的外观、颜色、材质、按键结构和品牌标志,不得改变产品设计。

视频1仅用于参考镜头环绕人物的运动方式和节奏,不参考视频中的人物、场景和服装。

音频1用于参考女主角的声音音色、语速和自然停顿,不复用音频中的原始台词。

生成一段10秒、16:9的科技产品广告。画面位于简洁的银白色未来空间中。女主角佩戴图2中的银色耳机站在画面中央,保持图1中的人物外观和服装。

0—3秒:镜头从女主角侧后方开始,参考视频1的环绕方式,缓慢移动到人物正面,耳机表面出现柔和高光。

3—7秒:女主角抬起右手轻触耳机侧面按键,周围出现细小的声波粒子效果。她使用音频1的音色和语速说:“戴上它,听见属于自己的世界。”

7—10秒:镜头继续缓慢靠近耳机产品,人物轻轻闭上眼睛,背景空间逐渐变暗,耳机轮廓保持清晰。

保持人物身份、耳机结构和品牌标志稳定。声音包括轻微按键声、空间环境声和低频电子音乐,人物口型与台词自然同步。

相比“参考这些素材生成一个广告”,这种写法最大的区别是:

每个参考素材都有明确任务。

官方完整参考模式还会进一步区分人物、图片、视频和音频的作用,并说明它们是需要完整保留、部分保留、属性迁移,还是只参考风格或节奏。

  

六、多个参考素材应该怎样分工?🔖


可以直接参考下面这张表:

素材可以参考的内容提示词写法
人物图片面部、发型、服装、身份图 1 用于参考人物外观和服装
产品图片结构、材质、颜色、Logo图 2 用于参考产品外观,不得改变结构
场景图片建筑、背景、光线、构图图 3 用于参考场景和整体光线
动作视频人物动作、姿势、节奏视频 1 仅参考人物动作
运镜视频推拉、环绕、跟拍、转场视频 2 仅参考镜头运动
风格视频色调、剪辑、画面质感视频 3 参考整体影像风格
人声音频音色、语速、情绪音频 1 参考人物声音,不复用台词
音乐音频节奏、配器、音乐风格音频 2 参考音乐节奏和配器

  

不要只写:

参考图1、图2和视频1。

而应该写:

图1参考人物,图2参考产品,视频1只参考动作,不参考其中的人物和背景。

这一点往往比增加更多形容词更重要。

  

七、MiniMax-H3 提示词的6个实用技巧 🔖


🔹 7.1 先写动作,再补风格

先确定人物做什么、镜头怎么走,再补充电影感、广告感或动画风格。

不要一开始就堆满:

电影感、大师级、震撼、极致、顶级、超高质量。

这些词不能代替具体画面。

  

🔹 7.2 使用可以被看见的动作

模糊表达:

女孩感到悲伤。

具体表达:

女孩低下头,握紧手中的照片,眼眶逐渐湿润。

模型更容易理解可以直接呈现在画面中的行为。

  

🔹 7.3 每个镜头只安排一个主要运镜

例如:

  • 缓慢推近
  • 向右平移
  • 环绕人物
  • 跟随人物移动
  • 保持固定镜头

不要在一个短镜头里同时要求快速推近、拉远、旋转和升高。

  

🔹 7.4 多个动作使用时间线

只有一个简单动作时,可以自然描述。

动作较多时,使用:

0—3秒
3—6秒
6—10秒

这样更容易控制节奏。

  

🔹 7.5 不要忽略声音

MiniMax-H3 可以同时生成视频和声音,因此提示词中可以写:

  • 环境声
  • 动作音效
  • 人物对白
  • 人物呼吸或笑声
  • 背景音乐
  • 音乐的速度和乐器

官方提示词结构会分别描述整体环境与动作声音,以及只有观众能够听到的背景音乐。

  

🔹 7.6 明确哪些内容不能改变

使用参考素材时,可以增加:

保持人物面部、服装和身份一致。
保持产品外形、颜色、材质和Logo稳定。
不参考视频中的人物,只参考镜头运动。
不复用参考音频的原台词,只参考音色。

  

八、三类提示词的万能模板 🔖


🔹 8.1 文生视频模板

【时长、比例和风格】
在【时间和场景】中,【主体外观与位置】。

0—X秒:【主体动作+镜头运动】。
X—X秒:【画面变化+主体动作+镜头运动】。
X—X秒:【结束动作+最终画面】。

声音包括【环境声】【动作音效】【对白】。背景音乐使用【乐器、速度和节奏】。
保持【人物、物体或场景的一致性要求】。

  

🔹 8.2 图生视频模板

以图1作为视频首帧,保留图中的【人物、服装、物体、构图、场景和光线】。

视频开始后,【主体从静止状态开始做什么】,随后【动作如何连续发展】。镜头使用【运镜方式】,最终停在【结束状态】。

声音包括【环境声和动作音效】。
保持【人物身份、产品结构或场景】稳定。

  

🔹 8.3 首尾帧模板

图1作为视频0秒首帧,图2作为视频X秒尾帧。

开始时保持图1中的【人物状态和构图】。主体先【第一个动作】,接着【中间变化】,最后【逐渐接近尾帧的动作】。镜头使用【单一连续运镜】,最终准确落在图2中的【姿势、物体状态、构图和光线】。

全程保持【人物、服装、物体和场景】一致。声音包括【环境声、动作声音和音乐】。

  

🔹 8.4 全能参考模板

图1用于参考【人物、产品、场景或风格】。
图2用于参考【具体内容】。
视频1仅用于参考【动作、运镜、节奏或剪辑】,不参考【排除内容】。
音频1用于参考【音色、音乐、节奏或声音】,不复用【排除内容】。

生成一段【时长、比例和风格】视频。

0—X秒:【镜头和动作】。
X—X秒:【镜头和动作】。
X—X秒:【结尾画面】。

保持【必须一致的内容】,不得改变【产品结构、人物身份、Logo或文字】。
声音包括【环境声、音效、对白和背景音乐】。

  

九、不会写提示词?让 AI 帮你写 🔖


很多人看完模板还是会觉得麻烦。

其实没有必要自己一个字一个字组合。

你只需要告诉 AI:

一个女孩在雨夜逃跑,最后回头看,想要电影感。

然后让 AI 根据固定规则,自动补充人物、动作、镜头、时间线和声音。

下面这套指令可以直接复制使用。

MiniMax-H3 视频提示词生成指令(精简版)

你是一名专业的AI视频导演和MiniMax-H3提示词设计师。
你的任务是将用户简单、混乱或不完整的视频想法,整理成清晰、可执行、适合MiniMax-H3的视频生成提示词。
MiniMax-H3主要包含三种生成模式:
1.文生视频:只使用文字生成视频。
2.图生视频或首尾帧生视频:使用一张首帧图片,或者首帧和尾帧两张图片。
3.全能参考生视频:使用人物、产品、场景、风格图片,以及动作、运镜、剪辑视频或音频作为参考。
请先根据用户提供的素材自动判断生成模式。
模式判断规则:
-没有上传任何素材:文生视频。
-上传一张作为视频开始或结束画面的图片:图生视频。
-上传首帧和尾帧两张图片:首尾帧生视频。
-上传图片、视频或音频用于参考人物、产品、场景、动作、镜头、风格或声音:全能参考生视频。
-首尾帧素材与全能参考素材不要混淆。
提示词编写规则:
1.使用自然、清楚、具体的语言,不要堆砌空洞关键词。
2.明确视频时长、画面比例和整体风格。
3.描述主体的外观、位置、动作和状态变化。
4.描述动作从开始到结束的连续过程。
5.动作超过一个时,使用时间段划分,例如0—3秒、3—6秒。
6.每个镜头只安排一个主要运镜。
7.镜头运动必须与人物动作和画面变化配合。
8.可以使用推近、拉远、平移、跟拍、环绕、升降、固定镜头等运镜。
9.描述环境声、动作音效、人物对白和背景音乐。
10.对白必须保持用户原文,不得自行修改。
11.使用参考素材时,必须明确每个素材的具体作用。
12.不得笼统地写“参考所有素材”。
13.明确哪些内容需要完整保留,哪些内容只参考风格、动作、运镜或声音。
14.如果参考视频只用于动作或运镜,明确说明不参考其中的人物、服装和场景。
15.图生视频需要从参考图的静止状态自然向前发展。
16.首尾帧生视频需要重点描述首帧到尾帧之间的动作路径,优先使用连续单镜头。
17.不得凭空增加用户没有要求的重要人物、产品、文字、Logo或剧情。
18.避免安排无法在指定时长内完成的复杂剧情。
19.保持人物身份、服装、产品结构、Logo和重要场景的一致性。
20.输出内容使用中文;人物对白、歌词和画面文字保持用户指定语言。
输出格式:
一、生成模式
说明判断出的生成模式。
二、素材分工
没有参考素材时写“无”。
有参考素材时,逐一说明每张图片、每段视频和每段音频负责什么。
三、提示词设计思路
用简短要点说明主体、动作、镜头、声音和结尾设计。
四、最终提示词
输出一份可以直接复制使用的完整MiniMax-H3提示词,不要在提示词中加入解释。
五、精简版提示词
在不改变核心内容的情况下,输出一份更短的版本。
用户输入信息:
生成想法:
【填写想生成的视频】
视频时长:
【例如8秒、10秒或15秒】
画面比例:
【例如16:9、9:16、1:1】
整体风格:
【选填】
参考图片:
【说明每张图片的内容;没有则填写无】
参考视频:
【说明每段视频想参考什么;没有则填写无】
参考音频:
【说明想参考音色、音乐、节奏或声音;没有则填写无】
人物对白:
【没有则填写无】
必须保留:
【人物、产品、Logo、文字等】
禁止出现:
【选填】
其他要求:
【选填】

  

十、最后总结 🔖


MiniMax-H3 提示词其实没有想象中那么复杂。

文生视频主要解决:

要生成什么,以及这个画面怎样动起来。

图生视频和首尾帧主要解决:

怎样从已有画面自然发展到下一个状态。

全能参考生视频主要解决:

每份参考素材分别提供什么,以及哪些内容必须保持一致。

真正影响视频效果的,通常不是提示词写得有多华丽,而是你有没有说清楚:

  • 谁出现在画面中
  • 他在哪里
  • 他做什么
  • 动作怎样发展
  • 镜头怎样拍
  • 最后停在哪里
  • 视频中听到什么
  • 参考素材分别负责什么

不会写也没有关系。

先把自己的想法用最简单的话说出来,再交给 AI 整理成完整提示词,就已经足够开始创作了。