前言 🔖
本文为 MiniMax H3 官方标准化提示词写作规范,覆盖四大主流生成模式:纯文本生视频、首帧参考生视频、首尾关键帧约束生视频、末帧反向推演生视频。所有输出文本主体使用英文,仅画面字幕、人物对白、歌词保留原始语种,适配 ComfyUI 本地工作流与官方 API,能大幅提升视频画面一致性、运镜流畅度、音频同步精度。
一、四大生成模式基础介绍 🔖
- 1. T2VA 纯文本生成音视频
- 仅依靠文字搭建完整音视频时间线,无任何参考图片约束,从零生成画面、动作、音效与背景音乐。
- 2. I2VA 首帧参考生成音视频
- 基于 T2VA 完整描述逻辑,额外增加首帧锁定指令;以一张参考图作为视频 0 秒初始画面,模型从该画面自然向前推演完整动态剧情。
- 3. FL2VA 首尾双关键帧生成音视频
- 基于 T2VA 描述逻辑,同时锁定开篇参考图与结尾参考图;模型自动生成连贯过渡动作,补全两张静态画面中间全部运动过程。
- 优先使用单镜头,保证画面插值顺滑;仅特殊分镜需求下才添加多段镜头,末帧必须落在视频最后一个镜头结束位置。
- 4. L2VA 末帧约束反向生成音视频
- 基于 T2VA 描述逻辑,仅锁定一张参考图作为视频结尾帧;需要合理铺垫前置画面、动作、运镜,让画面循序渐进收敛至参考末帧。
二、提示词标准完整结构 🔖
整套提示词分为两大模块:对齐约束指令(首行必填) + 三大核心描述字段,指令与核心字段之间必须空一行分隔。
🔹 2.1 第一模块:素材对齐指令(放在全文最开头)
- T2VA
- 无图片对齐指令,直接书写三大核心字段。
- I2VA 固定开头(锁定 0 秒首帧)
目标视频0.00秒时刻,完整复用<图片1>(来自【镜头1】)作为初始画面。
- FL2VA 固定开头(绑定首尾两张参考图)
参考图与目标视频对齐规则:图片1(镜头1)对应视频0.00秒帧;图片2(最终镜头N)对应视频S.SS秒帧。
N = 最后一段镜头编号;S.SS = 视频总时长,强制保留两位小数。
- L2VA 固定开头(仅锁定结尾帧)
参考图与目标视频对齐规则:<图片1>(最终镜头N)对应视频S.SS秒结束帧。
🔹 2.2 第二模块:三大核心必填字段
integrated_multimodal_description: 镜头时序完整描述
overall_soundscape: 全局环境音效总结
non_diegetic_music: 专属观众背景配乐描述
- integrated_multimodal_description(主体核心)
- 按时序描述全片画面、人物动作、镜头切换、运镜、说话人、对白、演唱、画面原生同步音效(剧中角色能听见的声音)。
- overall_soundscape(环境音汇总)
- 用 1~4 句话概括全程环境氛围音、物体碰撞声、人体非语言声响(风声、雨声、脚步声、衣物摩擦、喘息、笑声等)。
- 对白、演唱、画面内原声音乐已写在主描述内,此处禁止重复;全程无任何声音填 N/A。
- non_diegetic_music(画外配乐)
- 描述只有观众能听见、剧中人物无法感知的背景音乐;只写乐器、速度、节奏、音量起伏,不堆砌抽象情绪形容词。
- 角色能听见的收音机、电视、手机音乐属于画面原声,写进主描述;无配乐填 N/A。
三、关键帧模式描述写作逻辑 🔖
🔹3.1 I2VA 首帧参考写作思路
<图片 1> 固定为 0 秒开篇镜头画面,写作顺序:
首帧画面锚定(画风、人物、构图、场景)→ 动作启动 → 持续动态演变 → 最终反应 / 结果
全程保持人物长相、穿搭、色彩、道具、空间位置不崩坏。
🔹3.2 FL2VA 首尾双帧写作思路
图片 1 = 开场画面,图片 2 = 结尾画面,重点刻画:人物移动、姿势变化、物体交互、构图演变、光影转场。
写作顺序:初始画面状态 → 中间连续变化过程 → 逐步缩小与末帧差异 → 定格至结尾参考图。
🔹3.3 L2VA 末帧约束写作思路
参考图仅作为视频收尾画面,不作为开场;先合理铺垫前置场景,再描写所有元素逐步收敛至末帧。
写作顺序:合理前置画面状态 → 完整动作与转场流程 → 末尾镜头逐步收敛 → 精准定格到参考末帧。
四、三大核心字段详细书写规范 🔖
🔹 4.1 多模态时序描述书写要求
这是整套提示词最重要的主体部分,每一处文字都要有对应的可视画面或可听见声音:美术风格、初始构图、人物外貌位置、场景道具、动作反应、镜头切换、台词、同步原声。
【镜头 1】开头必须标注整体美术风格,常用风格词:电影质感、真人实拍、2D 动画、3D 渲染、黏土定格、水彩、复古胶片。
示例:
[Shot 1] 真人实拍,电影质感,中宽镜头取景……
🔹 4.2 镜头与画面硬切规则
- 第一个镜头不添加时间戳;后续镜头使用严格递增的时间戳标注切点(格式:00:XX.XXX)
[Shot 2] At 00:03.500, the camera cuts to...
- 普通转场用词:镜头切至、画面过渡至、镜头切换至;特殊需求可使用淡入淡出、叠化、划像转场。
- 镜头切换逻辑:切换必须带来新信息(新场景、新视角、新人物状态、新时间);仅改变拍摄远近、轻微角度微调,优先使用运镜描述,不要频繁切镜头。
🔹 4.3 标准运镜写法:运动类型 + 幅度 + 速度
运镜描述嵌入镜头自然语句,不要在句尾堆砌标签;中等幅度、常规速度可省略不写。
运镜类型清单:
| 运镜分类 | 英文标识 | 释义 |
|---|---|---|
| 变焦 | Zoom In / Zoom Out | 机位不动,调整焦距拉近 / 拉远 |
| 机身推拉 | Push In / Pull Out | 整机向前推进 / 向后后退 |
| 水平摇镜 | Pan Left / Pan Right | 机位固定,镜头左右水平转动 |
| 横向平移 | Truck Left / Truck Right | 整机左右平行移动 |
| 垂直俯仰 | Tilt Up / Tilt Down | 机位固定,镜头上下俯仰 |
| 整机升降 | Pedestal Up / Pedestal Down | 整套镜头垂直上下移动 |
| 环绕运镜 | Arc Shot | 镜头沿弧形环绕主体 |
| 跟拍 | Tracking Shot | 跟随移动物体同步运动 |
| 固定镜头 | Static Shot | 机位、焦距全程静止 |
| 镜头抖动 | Shake Slightly / Shake Strongly | 轻微抖动 / 剧烈抖动 |
| 主观视角 | POV | 角色第一人称视角 |
| 镜头旋转 | Roll Clockwise / Roll Counterclockwise | 镜头顺时针 / 逆时针旋转 |
幅度 & 速度:
- with small amplitude 小幅运动;with large amplitude 大幅度运动
- at slow speed 慢速;at fast speed 快速
标准示例:
镜头小幅缓慢推向她手中折叠的信件
镜头大幅度快速右摇,露出敞开的房门
固定镜头,目送奔跑者离开画面
🔹4.4 说话人、对白、演唱规范
- 发声人物统一分配固定编号 (S1)(S2),多人同时发声标记 (S1,S2);同一个角色全片共用同一个 ID,不出声人物不分配编号。
- 角色首次发声时,补充音色、年龄、语速、声线特征;人物动作、ID、声线描述放在
<d>标签外部;标签内仅保留语种 + 原文台词,一字不改、不翻译、不改写。
示例:
声线轻柔气音的年轻女生 (S1) 开口说道:<d>[English] I get off at the next station.</d>
两个孩童 (S1,S2) 一同大喊:<d>[English] Wait for us!</d>
- 画外音标准写法:says in an off-screen voiceover,同时补充人物嘴唇全程闭合。
示例:
男人 (S1) 画外音旁白:<d>[English] I still remember that road.</d>,画面中人物嘴唇完全没有开合。
- 跨镜头台词、截断台词标记
<scenetrans>:台词跨镜头延续,搭配描述音频无缝衔接、持续传入下一镜头;<cutoff>:台词在视频结尾被强行截断。
🔹 4.5 画面内可见文字
门店招牌、霓虹灯、字幕、标语全部用英文双引号包裹,原文原样保留,不翻译。
示例:门口上方亮起红色霓虹灯,文字为 "营业中"。
🔹 4.6 overall_soundscape 环境音效书写示例
overall_soundscape: 持续细雨敲打咖啡馆玻璃窗,伴随微弱室内底噪;店门铃铛响一声,随后传来湿滑脚步声与椅子轻微拖拽声。
🔹 4.7 non_diegetic_music 背景配乐书写示例
non_diegetic_music: 舒缓稀疏钢琴单音,缓慢节奏,底层铺垫绵长低音弦乐,音量逐步升高后缓缓淡出。
五、四大模式完整可复制案例 🔖
🔹 案例 1:T2VA 纯文本生成
无参考图,纯文字构建完整时间线,可合理补充场景、人物、音效细节。
integrated_multimodal_description: [Shot 1] 真人实拍,电影质感,中宽镜头拍摄日出前街边面包店,烘焙师傅推开木质百叶窗。镜头小幅缓慢向前推进,声线沉稳略带沙哑的中年烘焙师(S1)将新鲜面包摆上木柜台,开口说道:<d>[English] First batch of the morning.</d>
[Shot 2] At 00:05.000,镜头切至面包切片升腾热气的特写,烘焙师上一句台词跨镜头持续播放。
overall_soundscape: 安静街道上木质百叶窗摩擦开启,店内托盘轻碰;门铃响起,伴随轻快脚步声与面包清脆切片声。
non_diegetic_music: 轻柔原声吉他循环,中等节奏,搭配稀疏低音提琴音符,片尾缓慢淡出。
🔹 案例 2:I2VA 单图首帧参考
开头必须先写首帧对齐指令,以参考图作为镜头 1 初始画面,再描述后续动态。
目标视频0.00秒时刻,完整复用<图片1>(来自【镜头1】)作为初始画面。
integrated_multimodal_description: [Shot 1] 真人实拍,电影质感,<图片1>中的年轻女生坐在布满雨水的列车窗边,外貌、穿搭、座位、车厢布局完全保留。镜头小幅缓慢向右平移,她放下手中折叠的信件,望向窗外掠过的城市灯火,玻璃映出她的倒影。声线轻柔气音的年轻女生(S1)说道:<d>[English] I get off at the next station.</d>,她沿着原有折痕重新叠好信纸。
overall_soundscape: 车轮持续金属摩擦声,搭配微弱通风嗡鸣;雨水敲打车窗,纸张轻微沙沙作响。
non_diegetic_music: 绵长大提琴低音,缓慢节奏,搭配稀疏钢琴高音,音量逐步减弱。
🔹 案例 3:FL2VA 首尾双帧参考
两张参考图分别锁定视频开场与收尾。提示词不要单纯描写两张静态图片,重点书写二者之间完整连贯的动作变化流程,下面是一段 8 秒单镜头示范。
参考图与目标视频对齐规则:图片1(镜头1)对应视频0.00秒帧;图片2(镜头1)对应视频8.00秒帧。
integrated_multimodal_description:[Shot 1] 真人实拍,电影质感,浑身淋雨的骑行者起始姿态、取景构图完全沿用图片1,她伫立在银色自行车旁,手里攥着收拢好的黑色雨伞。镜头小幅缓慢向后拉远,她松开自行车车把手,将雨伞举至肩头上方,向上推动伞滑套直至伞面撑开。雨水顺着舒展的伞布滚落,她移步躲到伞下,转动伞柄调整至最终角度,在镜头末尾,人物姿势、物体间距以及整体构图和图片2保持一致。
overall_soundscape:雨水持续敲打路面,接着传来伞骨卡扣的金属响动、伞面撑开的清脆声响;水珠从车架不断滴落,远处传来来往车流的环境噪音。
non_diegetic_music:无
🔹 案例 4:L2VA 末帧锁定参考
仅使用一张参考图锁定视频结尾画面。先搭建合乎逻辑的初始画面,再通过动作演变、物体状态变化、构图推移,在镜头尾声慢慢收敛至参考图,下面为 6 秒单镜头示例。
参考图与目标视频对齐规则:<图片1>(镜头1)对应视频6.00秒结束帧。
integrated_multimodal_description:[Shot 1] 真人实拍,电影质感,特写镜头最开始,完好的玻璃杯摆放在深色木桌桌边,参考图当中同款衣袖的手从画面右侧伸入。镜头小幅缓慢向前推进,指尖触碰杯沿,玻璃杯倾斜滑落重重砸向地面,杯身裂开,碎片四散滑行。临近视频结尾,滑动的碎片慢慢停下,碎裂排布、手部位置、拍摄角度、光影氛围、整体构图完全和<图片1>一模一样。
overall_soundscape:指尖轻叩杯壁,玻璃杯在桌面摩擦、坠落、猛地碎裂;细小碎片四散滚落,最后慢慢停止滑动。
non_diegetic_music:低沉缓慢的电子脉冲音效,玻璃杯碎裂之后音效立刻终止。