十二种运镜怎么写进 MiniMax H3 提示词:Zoom 与 Push 到底差在哪

2026-08-09

写 AI 视频提示词时,“镜头怎么动”是最容易糊弄过去的一层。很多人习惯在句子后面挂一串标签——push in, slow, cinematic——然后指望模型自己领会。MiniMax H3 官方给的写法不是这样的。

截至 2026-08-09 的 MiniMax-AI/MiniMax-H3 仓库里带了一个专门的提示词写作 skill,安装命令 README 写得很直白:

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

它是仓库附带的九个 skill 之一(另外八个是风格化的视频生成 skill)。h3-prompt-writing 目录下带两份提示词指南:references/base-en.txt 管文本与关键帧模式,references/ref-en.txt 管全参考的 Ref2VA 模式。本文讲的运镜规则,全部来自 base-en.txt 与 SKILL.md 的原文口径。

一、先搞清楚运镜写在哪个位置

H3 提示词的三个核心字段顺序固定:integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music。SKILL.md 的 Output Rules 明确要求保留字段名、章节顺序、标签与时间标注法,所以这三个名字一个字母都不能改。

运镜属于第一个字段。integrated_multimodal_description 的职责是沿时间线描述画面、动作、镜头、说话人、对白、演唱与场景内音频——镜头运动是它内部的一部分,不是另起一行的参数。SKILL.md 还要求每个镜头都要从构图、主体、环境、动作、镜头运动、声音,以及被引用内容出现的确切时点去描述,并明确列出三条要避免的写法:剧情梗概式写法、悬空未定义的参考标签、与请求时长不匹配的时间标注。

第一条”剧情梗概式写法”就是运镜写不进去的常见后果——只交代发生了什么事,不交代摄影机在做什么。

二、十二种运动类型的原表

指南把运镜拆成三要素:运动类型 + 幅度 + 速度。运动类型的原表如下,成对的写法(如 In/Out、Left/Right)算作同一类:

运动类型官方给的含义
Zoom In / Zoom Out机位不动,焦距变
Push In / Pull Out机身前后移动
Pan Left / Pan Right机位不动,镜头水平摇
Truck Left / Truck Right机身水平平移
Tilt Up / Tilt Down机位不动,镜头垂直摇
Pedestal Up / Pedestal Down整机升降
Arc Shot绕主体做弧线运动
Tracking Shot跟随移动的主体
Static Shot完全不动
Shake Slightly / Shake Strongly轻微/强烈晃动
POV主体视角
Roll Clockwise / Roll Counterclockwise绕镜头轴滚转

这张表的价值不在于它列了多少个词,而在于前六项里藏着三组两两对应的概念,官方是把它们分开写的。

三、三组必须分清的写法

Zoom 与 Push:焦距变 vs 机身动

这是最常被混着写的一组。官方对 Zoom In / Zoom Out 的定义是”机位不动、焦距变”,对 Push In / Pull Out 的定义是”机身前后移动”。

判断依据其实只有一个问题:摄影机的位置有没有变? 没变、只是把画面拉近拉远,那是 Zoom;机器整个往前顶或者往后退,那是 Push / Pull。两者在真实拍摄里的成像差别是常识层面的——变焦不改变机位与被摄体的空间关系,移机会改变。所以当你想表达”逼近某个东西”这种带空间纵深感的动作时,写 Push InZoom In 更贴合意图;想表达”取景范围收紧”这种纯构图动作时,才是 Zoom In

中文里”推镜头”这个词恰恰同时被用来指这两件事,这是混淆的源头。写英文提示词时没有这个歧义空间,得自己先选定。

Pan 与 Truck:镜头摇 vs 机身平移

Pan Left / Pan Right 是”机位不动、镜头水平摇”,Truck Left / Truck Right 是”机身水平平移”。

同样一个判断问题:机器是在原地转,还是整体挪了位置。原地转就是 Pan——想象一个架在三脚架上的机器左右转头;机器沿着轨道横向走就是 Truck。两者拍出来的东西差别很大:Pan 是站在一个点上扫视环境,Truck 是跟着走过一段空间。

Tilt 与 Pedestal:镜头垂直摇 vs 整机升降

Tilt Up / Tilt Down 是”机位不动、镜头垂直摇”,Pedestal Up / Pedestal Down 是”整机升降”。这一组是上一组的垂直版本:Tilt 是原地抬头低头,Pedestal 是整台机器往上升或往下降,机位高度真的变了。

想表达”从脚扫到头”用 Tilt,想表达”镜头从地面高度升到齐眼高度”用 Pedestal。

把这三组归纳成一句:先问机位动没动,再问是位移还是转动。 六个词就此各归其位。

四、幅度和速度:默认值就是不写

幅度只有两个词:with small amplitudewith large amplitude。速度也只有两个:at slow speedat fast speed

指南明说:中等幅度与常规速度通常省略不写,只在有意义的时候才加。

这条规则挺反直觉——写提示词的人本能是把能填的槽全填满,觉得写得越细越可控。但这里的设计是”两档 + 一个隐含的中间默认值”,你不写就是中间档。所以:

  • 想要一个不快不慢、幅度正常的推镜,就写 The camera pushes in toward ...,不加任何修饰。
  • 只有当这个镜头就是要慢、要轻,或者就是要猛、要大幅,才把 with small amplitude / at slow speed 之类补上。
  • 每个镜头都挂满 with large amplitude at fast speed,等于把”强调”这个手段用废了。

判断依据可以简化为一句:这个幅度或速度是不是你要传达的信息本身? 是就写,不是就删。

五、写成句子,不是堆标签

这是这套体系里最硬的一条格式要求:运镜要作为镜头内自然的英文动作来写,而不是把标签堆在句尾

指南给出的示例句是:

The camera pushes in with small amplitude at slow speed toward the folded letter

拆开看它的构造:主语是 The camera,谓语是动词形式的 pushes in(不是名词标签 Push In),然后按”幅度 → 速度 → 对象”的顺序接下去。三要素被写进了同一个自然句里,读起来是一句英文,而不是一串参数。

所以从原表里取词的时候要做一次转换:表里给的是类型名(Push In),落到句子里要变成动词(pushes in),并明确”朝什么”。Tracking Shot 落到句子里是”摄影机跟随某个主体”,Arc Shot 是”摄影机绕着某个主体做弧线运动”——写清楚绕的是谁。Static Shot 也一样需要显式写出来,它表示完全不动,是一个明确的选择,不是省略。

六、什么时候该动镜头,什么时候该切一刀

运镜和切镜是一对替代关系,指南给了很清楚的取舍原则。

切换的措辞是五选一the camera cuts tothe shot cuts tothe shot transitions tothe shot changes tothe shot switches to。交叉溶解、淡入淡出、划像这类特殊转场,只有用户明确要求时才用——不要自作主张给每个切点安排一个花哨转场。

取舍原则:一次切换应当带来新信息,也就是主体、空间、状态、视角或时间上发生了变化;如果只是距离或角度略有变化,优先用运镜而不是切镜

这条规则实际用起来很好判断。你想让画面从中景变成特写——主体没换、空间没换、时间没走,只是离得更近了,那就不该切,该写一个 Push In。反过来,从室内切到室外、从一个人切到另一个人、从白天切到夜里,这才配得上一个切点。

顺带一提,这条原则会反向影响你的镜头数规划:一段十秒的视频如果切了六刀,多半有几刀是”只改了距离”的假切换,应该合并回运镜。

七、时间戳格式:第一个镜头不写时间

镜头的时间标注规则很具体,写错了属于 SKILL.md 明确列出的”与请求时长不匹配的时间标注”这类要避免的问题:

  • 第一个镜头不加时间戳,直接 [Shot 1] 开头。
  • 后续镜头用递增编号,且每一个都以切点时间开头,格式是:
[Shot 2] At 00:03.500, the camera cuts to...
  • 时间必须严格递增,并且落在视频时长之内

也就是说 [Shot 2] At 00:03.500 后面不能出现 [Shot 3] At 00:02.000,也不能在一段八秒的视频里写出 At 00:09.000。这两类错误写脚本时很容易犯——尤其是中途调整了镜头顺序、忘了同步改时间。

把前面几节拼起来,一个两镜头片段按官方规则组合大致长这样:

integrated_multimodal_description: [Shot 1] A medium shot of a wooden desk by the window. The camera pushes in with small amplitude at slow speed toward the folded letter.

[Shot 2] At 00:03.500, the shot cuts to a rooftop at dusk. The camera tilts up from the railing to the skyline.

以上是按官方 base-en.txt 的规则组合出来的示例(其中 The camera pushes in with small amplitude at slow speed toward the folded letter 一句是指南原文给的示例),未在本机验证过任何生成结果,具体以官方 skill 文档为准。注意这里的取舍:第一镜内部用了 Push In(只是靠近,不切),第二镜换了空间和时间(傍晚的天台),才用了切换措辞。

八、这套规则的边界

有两件事要说清楚,免得把预期放错位置。

第一,这些格式规则来自官方 h3-prompt-writing skill 的 references/ 文档,官方给的是写法规范,没有给任何效果对比数据。所以不存在”这样写效果提升多少”的说法,本文也不提供这类结论。

第二,官方的完整链路里有一个 H3-Context-IR 模块负责把用户输入整理成这套结构化提示词,而这个模块未开源、只有 API。README 给的替代路径是按 “Prompting Guidance” 自己搭一套上下文处理系统——也就是照着本文这些规则手写或用别的模型生成。这是官方认可的路子,但它不等于能得到与官方 API 相同的结果,这层限制得自己心里有数。

真正可复用的收获其实就三条:机位动没动决定了你该用 Zoom 还是 Push、Pan 还是 Truck、Tilt 还是 Pedestal;中等幅度和常规速度不写;只改距离或角度时别切镜。剩下的是把它们写成通顺的英文句子。

延伸阅读


本文依据 MiniMax H3 官方仓库(github.com/MiniMax-AI/MiniMax-H3)的 README、 模型配置文件与官方 h3-prompt-writing skill 文档整理,核对日 2026-08-09。 本文内容为官方仓库口径,未在本机部署或调用过 H3。 模型、部署方式与许可条款以官方最新说明为准。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。