限时 5 折优惠!领取优惠

MiniMax H3 Max 视频提示词指南:T2VA、I2VA、FL2VA、L2VA

作者 Jordan Hale · 发布于 2026-08-26 minimax-h3-maxvideo-promptt2vai2vafl2val2vatext-to-videoimage-to-videohow-to
MiniMax H3 Max 视频提示词指南:T2VA、I2VA、FL2VA、L2VA

TLDR

  1. 动笔前先数静图。没有图用 T2VA。一张作开场用 I2VA。一张作结尾用 L2VA。开场加结尾用 FL2VAMiniMax 视频提示词写作指南)。
  2. 三个字段按这个顺序写:integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music同一份指南GitHub 副本)。
  3. 关键帧模式要先写首行对齐指令,空一行,再写三个字段。T2VA 跳过这一行
  4. MiniMax H3 Max 返回带原生立体声的短片,最长 15 秒,分辨率最高 2KMiniMax H3 发布帖开源规格)。
  5. 写完后把整段贴进 MiniMax H3 Max 视频生成器,并附上该模式要求的静图。

核心要点

  • 模式由手头素材决定,不是凭感觉选。 你实际有的静图决定 T2VA / I2VA / FL2VA / L2VA;选错会把画面锁在时间轴上错误的时刻(提示词写作指南)。
  • 三个字段各司其职。 画面、动作、切镜、说话人和台词写在 integrated_multimodal_description。房间底声、脚步、非言语的人声写在 overall_soundscape。角色听不到的配乐写在 non_diegetic_music
  • Shot 1 不加时间码。 后续镜头才在片长内写递增的切入时间。Shot 1 加时间戳是指南里点名的失败写法(指南 §4.2)。
  • 运镜写成句子,不要堆标签。 在镜头里写运动类型 + 幅度 + 速度:「The camera pushes in with small amplitude at slow speed…」(指南 §4.3)。
  • 时长数字必须对齐。 公开输出是整数秒的 4–15 秒;末帧行上的 S.SS 必须等于你这次生成的长度(平台视频指南提示词写作 SKILL)。
  • 上手: 把 Prompt 1 或 Prompt 2 贴进视频生成器。还缺静图?先在图像页做好,再回到视频。

按手头静图选模式

MiniMax 公开的提示词写作指南把四种文本/关键帧形态拆开写(Hugging Face 指南GitHub base-en.txt)。平台文档把同一家族写成文生视频、首末帧图生视频,以及另一条全参考路径(视频生成指南GitHub README)。

| 你实际手头有什么 | 用 | 提示词必须做什么 | 选错会怎样 | | --- | --- | --- | --- | | 只有一句话 | T2VA | 在三个字段里写完整条时间轴。不要写对齐行。 | I2VA/FL2VA/L2VA 的首行会要一张你没附上的 Picture 1,开场(或结尾)就锁不住。 | | 一张应当作首帧的静图 | I2VA | 首行把 Picture 1 钉在 0.00s / Shot 1,正文再顺着时间往后写。 | 写成 L2VA 会把这张静图当结尾。短片会往那里抵达,而不是从那里开始。 | | 一张应当作末帧的静图 | L2VA | 首行把 Picture 1 钉在 S.SS / 最后一镜,正文再往那里收。 | 写成 I2VA 会把静图冻在 0.00s。结尾不受约束,你在意的姿势常常丢。 | | 两张静图:开场结尾 | FL2VA | 首行把 Picture 1 对到 0.00s,Picture 2 对到 S.SS。尽量用一镜,路径才能真正接到末帧。 | 正文多切几刀,可能停在不是末帧图的那一镜。两张图却走 T2VA,等于无视对齐约定。 | | 多张图、片段或音频当可复用参考 | Ref2VA(本文不写) | 全参考是六段格式,不是这三个字段。 | 把多余素材塞进关键帧提示词,身份、运动或声音会丢——三字段形态写不下这些。 |

Ref2VA 是另一种格式:六段,不是三字段关键帧正文。本文不覆盖。

对齐行(原句照抄)

T2VA — 跳过。直接从 integrated_multimodal_description 开始。

I2VA:

For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA:

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA:

How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

N最后一镜的序号S.SS 是片长,保留两位小数(生成 8 秒就写 8.00)。这条指令放在第一行,然后空一行,再写三个字段(指南 §2.1)。

三个字段分别写什么

字段顺序固定(指南 §2.2):

  1. integrated_multimodal_description
  2. overall_soundscape
  3. non_diegetic_music

| 字段 | 写这里 | 不要写这里 | | --- | --- | --- | | integrated_multimodal_description | 风格、第一构图、服装、道具、动作、切镜、运镜句子、说话人 ID(如 (S1))、可复制块里那种 d 标签里的对白/唱词、英文双引号里的画面文字、跟动作同一下出现的画内声(扫描器扫到时的哔一声、店员听得到的收音机) | 情绪散文(“emotional”、“epic”)。堆在镜头末尾的抽象运镜标签。角色听不到的配乐。 | | overall_soundscape | 给整条短片写 1–4 句:环境声 + 物理动作 + 非言语人声(雨、风扇、脚步、纸、一口气、一声笑) | 对白、歌词、或画内音乐(这些已经写在描述字段里)。不要重复已经写过的句子。只有你明确要求全静音时才用 N/A。 | | non_diegetic_music | 1–3 句听得见的配乐:乐器、速度、节奏、音量变化。角色听不到这段。 | 抽象情绪词(“sad”、“uplifting”、“emotional function”)。角色听得到的手机/电视/收音机音乐写在描述字段。没有配乐就写 N/A。 |

常见「事实对、字段放错」

  • 把台词写进 overall_soundscape 嘴型和字要写在描述字段里,带 (S1)<d>。声景可以留一声笑或一口气,不要留整句。
  • non_diegetic_music 里写 “emotional piano”。 点出乐器、速度和力度。丢掉情绪形容词。
  • 运镜堆成标签。 镜头末尾写 Push In, Slow, Small,不如一句带类型 + 幅度 + 速度的英文句子(指南 §4.3)。
  • 改写画面上的字。 霓虹、包装字或界面字符串保持英文双引号,原文和标点都不要翻译(指南 §4.5)。
  • 为了「好听」改写对白。 <d> 里面保留用户的语言标签和原句。说话人识别写在 <d> 外面指南 §4.4)。

失败边界(生成前先核)

下面是公开指南点名的失败写法。照做,多半会浪费一条。

| 如果你这样做 | 通常会怎样 | 改法 | | --- | --- | --- | | 给 Shot 1 加时间戳 | 开场时间码会跟对齐行打架(或给 T2VA 编造一个它不用的开始时间) | Shot 1:只写风格 + 构图。第一条时间码放在 Shot 2+,递增,且在片长内([Shot 2] At 00:04.500, …) | | 把运镜标签堆起来,而不是写成句子 | 运动被忽略,或突然一跳 | The camera pushes in with small amplitude at slow speed toward the receipt. | | 把对白放进 overall_soundscape | 嘴型和字对不上;这句话挂不到 (S1) | 把原句挪进描述字段,放在 <d> 里。声景只写房间和身体动静。 | | 配乐只写抽象情绪词 | 音乐很泛,或跟画面打架 | 乐器 + 速度 + 音量变化。或者 N/A。 | | 翻译或润色台词 / 画面文字 | 模型「帮忙」之后,你要的那句没了 | 引原文。语言标签放在 <d> 里。包装字用 "double quotes"。 | | FL2VA 还切好几刀 | Picture 2 永远成不了最后一镜的末帧 | Picture 1 → Picture 2 用一镜,除非你真的需要切镜,并且 Shot N 仍在 S.SS 对上 Picture 2 | | S.SS 对不上时长 | 末帧锁太早、太晚,或根本没有 | 生成 8 秒 → 写 8.00。平台时长是整数秒 4–15平台规格) |

MiniMax H3 Max 的公开输出规格:最长 15 秒最高 2K原生立体声,开源规格表为 24 fps(发布帖开源公告2026 年 7 月 31 日发行说明)。托管分辨率写的是 768P / 2K平台规格)。每次生成只安排 一个动作要点

弱提示词 → 结构化提示词(两条原创)

下面是改写示例,不是官方那四个面包店 / 火车 / 骑行 / 玻璃杯案例。只借结构。不要把那四个场景当自己的需求贴进去。

Prompt 1 — T2VA(无静图)

弱开头: “cinematic convenience store, clerk talks, emotional music, 8 seconds.”

为什么失败: 没有分镜、没有说话人 ID、配乐用情绪词、声景和配乐没拆开、没有时长计算。

可直接粘贴(8 秒 T2VA):

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a late-night convenience store counter as a clerk in a navy polo scans a glass bottle of barley tea. Fluorescent light reflects on the wet raincoat of the customer across the counter. The camera trucks left with small amplitude at slow speed as the clerk with a low, even voice (S1) says: <d>[English] Receipt in the bag?</d> [Shot 2] At 00:04.500, the camera cuts to a close-up of the thermal printer peeling a receipt while the clerk's last words carry over from the previous shot.

overall_soundscape: Cooler fans hum behind the counter while rain ticks against the glass doors. The barcode scanner beeps once, followed by the soft tear of thermal paper.

non_diegetic_music: A muted electric-piano figure at a slow tempo, joined by a low analog bass pulse that fades after the receipt prints.

改了什么:Shot 1 没有时间码;Shot 2 是 8 秒内的 00:04.500;运镜写成句子;台词在 <d> 里,(S1) 在外面;声景是房间 + 动作;配乐点出乐器,而不是 “emotional”。

托管在 MiniMax H3 Max 上的文生视频画面参考静图

托管在 MiniMax H3 Max 上的文生视频画面参考 · 用来规划运动,不要当成调色完成的标准成片

Prompt 2 — FL2VA(两张产品静图)

弱开头: “animate these two pack shots, zoom in, upbeat music, a few cuts.”

为什么失败: FL2VA 要的是两帧之间的路径,通常用一镜。「切几刀」再加情绪词配乐,Picture 2 就永远到不了。

可直接粘贴(8 秒 FL2VA,单镜头): 合上的纸盒作 Picture 1,打开的纸盒 + 杯子作 Picture 2。

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a closed oatmeal-colored carton sits on a pale oak table in the framing established by Picture 1, lid sealed, one-color mark reading "AURA MUG" facing camera. The camera pushes in with small amplitude at slow speed as two hands enter from the lower edge, lift the lid along its scored fold, and set it aside. Tissue paper parts. A speckled ceramic mug rises into the exact placement, rotation, and table spacing established by Picture 2 at the end of the shot.

overall_soundscape: Soft room tone under a wooden table, then the dry scrape of a carton lid and the rustle of tissue. The mug taps once against oak as it settles.

non_diegetic_music: N/A

改了什么:对齐行在最前;S.SS = 8.00镜;包装字留在 "AURA MUG";运镜是类型 + 幅度 + 速度;没有配乐,因为产品就位往往不配乐更干净。

托管在 MiniMax H3 Max 上的首末帧风格静图

开场/结尾静图任务 · 托管在 MiniMax H3 Max · 规划用的生成风格静图

只要一张开场静图、不是两张?改成 I2VA:保留 I2VA 首行,把 Picture 1 写成 0.00s 的 Shot 1,再写接下来的动作——不要另写一件产品。

如何在 MiniMax H3 Max 上跑

  1. 按上面的表选模式。 还缺首帧或末帧,先在 图像生成器 生成或裁出来。
  2. 打开 MiniMax H3 Max 视频生成器。保持选中 MiniMax H3 Max。
  3. 把时长设成 4 到 15 的整数秒。提示词写了 8.00,就生成 8 秒。
  4. 粘贴 Prompt 1(T2VA)或 Prompt 2(FL2VA)。只在 I2VA / FL2VA / L2VA 时附静图。
  5. 先不拖进度条看一遍,再拖着看:切镜逻辑、身份、手、画面文字、声音是否对上事件。

MiniMax H3 Max 首页 是总览。贴进视频生成器,不要贴在首页。

已知 vs 不声称

| 已知(有出处) | 不知道 / 不声称 | | --- | --- | | 四种文本/关键帧形态:T2VA、I2VA、FL2VA、L2VA,对齐行固定,三个字段顺序固定(Hugging Face 指南GitHub base-en.txt,commit 35491cd,2026-08-05) | 不声称视频生成器上每个控件都标了这四个缩写。贴对的形态;有静图就附上。 | | MiniMax H3 Max 跟随公开发布规格:统一的文本/图像/视频/音频上下文、最长 15s最高 2K原生立体声发布帖,2026-07-31开源,2026-08-03发行说明) | 端到端生成耗时。没有可引用的、公开可核验的延迟数字。 | | 托管时长是整数秒 4–15 秒;托管分辨率 768P / 2K;首末帧接受 0–2 张图(平台视频指南,查阅于 2026-08-26) | 不声称随手一句话每次都会被自动改写成三个字段。字段要自己写。 | | 运镜语言是类型 + 幅度 + 速度,写在镜头句子里面;说话人用稳定的 (S1) ID;<d> 保留原句(指南 §4) | 没有人工过一遍,不保证包装字或口型像素级对齐。拿去用之前,放大检查文字和嘴型。 | | 全参考(Ref2VA)是另一套六段写法(GitHub README提示词写作 SKILL) | 六段正文。本文范围外。 |

FAQ

该用哪种 MiniMax H3 Max 模式?

数静图。没有 → T2VA。一张开场静图 → I2VA。一张结尾静图 → L2VA。开场和结尾 → FL2VA。额外的图、视频或音频当可复用参考 → Ref2VA,本文不写。

三个字段分别写什么?

描述字段:画面、动作、切镜、说话人、台词、跟动作同步的画内声。声景:1–4 句房间、材质和非言语人声。配乐:1–3 句角色听不到的配乐,或 N/A

Shot 1 能加时间戳吗?

不能。Shot 1 用风格和构图开场。第一条 At 00:… 写在后面的镜头,且必须落在片长内(指南 §4.2)。

对白写在哪里?

写在 integrated_multimodal_description,稳定的 (S1)(或 (S1,S2))在 <d> 外面,原句在 <d> 里面。不要把整句停在 overall_soundscape

运镜怎么写?

一句英文:运动类型 + 幅度 + 速度。例如:“The camera pans right with large amplitude at fast speed, revealing the open doorway.” 不要在后面追加一串标签。

为什么我的 FL2VA 短片对不上末帧?

通常是切太多,或 S.SS 对不上生成时长。尽量 Picture 1 到 Picture 2 用一镜,并把 S.SS 设成你选的那个整数秒时长。

Ref2VA 是什么?

全参考生成:最多 9 张图、3 段视频、3 段音频,合计 12 个文件(平台输入上限GitHub README)。用六段提示词。本文不覆盖。

MiniMax H3 Max 短片能有多长?

公开规格:最长 15 秒。平台指南写的是整数秒 4–15平台规格发布帖)。让 S.SS 跟这个数字同步。

在这里怎么试?

打开 MiniMax H3 Max 视频生成器,贴 Prompt 1 或 Prompt 2,模式需要时附静图,生成,再全屏复看。

画面文字或台词要翻译吗?

不要。台词原文留在 <d> 里。可见文字用英文双引号,原标点一起保留。

提示词里的动作时间比片长还长怎么办?

MiniMax 的提示词写作说明要求描述时间对齐请求时长,且落在 4–15 秒窗口内(提示词写作说明)。砍一镜或删一句,不要把 20 秒动作塞进 8 秒生成。

关于 Jordan Hale

Jordan Hale 是 AI 视频提示词作者。他把 MiniMax H3 Max 的镜头需求写成可直接粘贴的 T2VA / I2VA / FL2VA / L2VA 提示词。本站 MiniMax H3 Max 上手提示词指南由他撰写。