一段出租车追逐戏,怎样同时保住角色、画风、动作和镜头?

图 1|影片片段中的女孩与出租车内景。原视频 01:50。

图 1|影片片段中的女孩与出租车内景。原视频 01:50。

女孩坐上出租车,司机带着她冲进拥堵的车流。接下来,汽车侧身穿过卡车之间的缝隙,原木飞起,动作越来越夸张。《Passport Rush》的这段追逐戏,展示了 AI 动画制作中一个很实际的问题:漂亮的单张图片,怎样变成设计一致、动作清楚、节奏成立的连续镜头?

Higgsfield Animation 的这期视频,由 Amina 拆解团队的制作过程。它最有价值的部分,是把角色设定、手工修改、三维预演和视频生成连接起来,并展示这些环节在哪里失效、又怎样修正。

本文据所提供的约 28 分钟视频及其中的中英字幕整理,按实际制作顺序重组。所有配图均为原视频截图,图注附有时间;文中的练习模板与检查表是整理后的教学补充。模型名称和界面操作仅对应视频演示版本。

01 先理解整条流程:资产优先,镜头分流

团队把方法概括为“资产优先”(asset-first)。这里的资产,是供生成模型参考的角色设定图、道具设定图、场景图等。先把这些图做清楚、做统一,再进入镜头制作。

可以把整条流程理解为:

故事与分镜 → 统一视觉资产 → 小规模视频测试 → 按镜头难度选择路线 → 生成、对照、修改。

  • 镜头情况:动作较简单,不需要精确设计运镜;视频采用的路线:提示词+必要的图像参考,直接生成视频;重点控制什么:构图、角色设计、画面风格
  • 镜头情况:动作顺序、机位或节奏有明确要求;视频采用的路线:先做 Blender 预演,再结合图像参考生成;重点控制什么:动作路径、镜头运动、发生时机

视频里的分镜用橙色标记需要 Blender 预演的镜头,未标记的镜头直接进入视频生成。这样的区分,可以让精力集中在真正需要控制的地方。

图 2|分镜中的橙色标记表示计划先做 Blender 预演。原视频 03:29。

图 2|分镜中的橙色标记表示计划先做 Blender 预演。原视频 03:29。

实际操作:先为每个镜头写清楚一个故事任务,例如“让观众看懂汽车侧身挤过缺口”。再判断:这个动作是否用文字就能解释清楚?如果反复描述仍然含糊,做一段预演可能更有效。

分镜也要留出调整空间。视频强调,团队保留故事节点和主要场景,同时允许生成结果带来变化。

02 制作角色资产:生成候选,再用手工确定设计

这部作品的方向是“风格化 3D 角色+水彩环境”。角色既要可爱、好笑,也要有适合夸张动作的比例和容易辨认的轮廓。

把想法整理成角色提示词

视频中,团队先把简短角色描述交给 Claude,整理为较完整的提示词,再人工检查。角色提示词主要包含外观、服装、姿势、构图和光照。

下面是依据这个方法整理的输入示例,并非原片提示词全文:

请把以下设计意图整理为角色设定图提示词:一位红色长发的年轻女孩,穿宽松蓝色连帽外套和运动鞋,耳机挂在颈部。整体采用有表现力的风格化 3D 造型。使用纯白背景、完整全身构图和柔和均匀的光照,让服装与身体比例容易辨认。不要添加无关物品。

整理后,要逐项检查文字有没有偏离设计。聊天模型负责帮助组织信息,最后取舍仍由创作者决定。

按视频中的界面生成候选

  1. 进入 Higgsfield 的 Cinema Studio 图像生成界面。
  2. 在模型选择器中选择 Soul 2.0。
  3. 粘贴检查后的角色提示词,设置适合设定图的画幅比例。
  4. 视频示范一次生成 4 张,比较候选方案。
  5. 选定方向后,继续调整比例、配色与细节。
图 3|视频演示在 Cinema Studio 中粘贴角色提示词。原视频 06:57。

图 3|视频演示在 Cinema Studio 中粘贴角色提示词。原视频 06:57。

这里的一次 4 张是演示设置,并不意味着每个项目都需要相同批量。真正要比较的是:角色是否符合故事、表情能否展开、轮廓是否鲜明,以及服装是否合乎情境。

从“看起来不错”改到“适合这部片子”

女孩的早期方案有的过于滑稽,有的偏写实,有的穿得过于正式。团队逐步保留红发与蓝色外套的对比,并继续修正比例。

选定生成版本后,团队在 Photoshop 中提高亮度与饱和度,在轮廓周围加入手绘笔触,让角色更有活力,同时保留整体的 3D 体积感。

图 4|女孩经过手工处理后的设计,蓝色外套、红发与白色耳机成为明显识别点。原视频 08:20。

图 4|女孩经过手工处理后的设计,蓝色外套、红发与白色耳机成为明显识别点。原视频 08:20。

出租车司机也经历了同样的流程。团队淘汰了不同视角发型不一致、皮肤和胡子过于塑料、表情显得疲倦的方案,最后选择戴帽子、留大胡子、神态放松的版本,再补充手绘细节。

图 5|司机的正面、背面和面部特写;手绘笔触用于统一角色的视觉语言。原视频 09:48。

图 5|司机的正面、背面和面部特写;手绘笔触用于统一角色的视觉语言。原视频 09:48。

这一步的产出:一套经过人工确认的角色参考图。使用前尤其要核对多视图中的发型、服装、配饰和比例,避免把不同设计混进同一份参考。

03 统一场景和道具:先测试它们动起来的样子

单张设定图成立,并不代表进入视频后仍然成立。团队在前期就把角色、背景和道具放进视频生成测试,提前发现了两个主要问题。

还有一个容易忽视的前测问题:角色设定尚未完成时,团队先用空车测试,结果反复出现陌生乘客。补入明确的角色参考后,这一现象在他们的测试中停止。因此,测试应尽量使用与最终镜头相符的完整输入。

场景缺乏层次:先调整光照

早期的纯水彩场景在测试中显得模糊、杂乱;正午设定又让画面平淡。团队保留场景方向,改用傍晚暖光和更明确的阴影,增加体积与纵深。

最终形成的项目经验是:先得到水彩风格的环境,再在镜头提示词里明确暖色低角度阳光、光照方向和阴影关系。

图 6|视频展示傍晚光照测试,暖光和阴影强化了车辆与环境的空间层次。原视频 11:19。

图 6|视频展示傍晚光照测试,暖光和阴影强化了车辆与环境的空间层次。原视频 11:19。

水彩车身在运动中失真:降低主体纹理复杂度

出租车几乎是第三位主角。团队不仅设计它的外观,还测试它的弹跳、挤压拉伸,以及与司机性格相呼应的动作。

早期出租车覆盖大量水彩纹理,静态设计很鲜明,但进入视频后,纹理像被拉伸在三维表面上的图片。团队最终把汽车改为较干净的 3D 外观,把浓重的绘画质感更多留给周围环境。

图 7|团队把出租车调整为较干净的 3D 外观,降低车身的纹理复杂度。原视频 13:55。

图 7|团队把出租车调整为较干净的 3D 外观,降低车身的纹理复杂度。原视频 13:55。

这是本片的测试结论,不能推导成“所有水彩主体都无法生成动画”。可复用的方法是:让资产进入运动测试,再决定保留多少纹理。

主车设计确定后,团队还制作了车顶被破坏后的去车顶版本,以及后座内部视角。视频演示用 Seedream 5.0 Pro 编辑已有图像,并以主车设计为参考,保持车辆身份一致。这里的去车顶版本是剧情损坏状态,不是重新设计一辆普通敞篷车。

重复出现的道具也需要独立参考。视频提到三辆卡车会跨镜头出现,因此分别制作设定图;短暂出现的其他元素则可以减少专门制作的投入。

片尾特效同样需要美术统一。团队曾用“蘑菇状爆炸”描述效果,结果生成了近似实体蘑菇的形态;调整措辞后,又在底图上手工加入绘画质感,才更贴近整部作品。

04 制作复杂动作:让预演负责运动,让图片负责外观

以“出租车从两辆卡车中间挤过去”为例,先把动作分清楚:

  1. 出租车接近两辆卡车之间的缺口。
  2. 车身侧倾,用同一侧的两个车轮支撑。
  3. 保持侧倾状态穿过缝隙。
  4. 离开卡车后,四轮落地,车身恢复稳定。

如果观众看不清这个先后顺序,再漂亮的镜头也无法清楚传达动作。

在 Blender 中先解决机位与节奏

团队在 Blender 里调整汽车什么时候开始倾斜、如何落地,以及相机怎样跟随。轮子加入适当的挤压拉伸,让车辆更有重量和性格。

预演的任务是展示动作和构图,因此无需先完成最终材质。视频说明,输出的是简化的灰模预览,用来提供运动、机位和节奏参考。

图 8|在 Blender 时间线中调整汽车侧倾与镜头跟随。原视频 19:45。

图 8|在 Blender 时间线中调整汽车侧倾与镜头跟随。原视频 19:45。

进入视频生成时,明确每份参考的职责

  • Blender 预演视频:运动顺序、镜头运动、节奏与空间关系
  • 出租车、卡车参考图:最终车辆设计与材质方向
  • 女孩、司机参考图:人物造型、服装与配饰
  • 道路、光照参考图:场景外观和光影方向
  • 场景提示词:解释动作、分配参考用途、补充限制
图 9|在 Higgsfield 中同时附加预演视频和多张图像参考。原视频 20:09。

图 9|在 Higgsfield 中同时附加预演视频和多张图像参考。原视频 20:09。

视频中的这一界面显示 Seedance 2.5、References、16:9、1080p、7 秒。这些是该次演示的设置;学习时应优先掌握输入的分工,而不是把界面参数当成通用配方。

生成后,把结果与预演逐项比较:倾斜是否发生在正确时机?是否穿过卡车后才落地?镜头有没有丢失主体?角色和汽车是否仍符合设定?

05 把视频提示词写成五个模块

团队将提示词结构固定下来,再让 Claude 按结构整理每个镜头。这样既便于复用,也更容易检查遗漏。

模块一:场景背景与风格

说明发生什么、采用什么画面风格,以及这个世界允许什么样的运动。例如,出租车追逐发生在公路上,角色与主车采用风格化 3D 外观,环境保留水彩感,动作允许夸张但要清楚可读。

图 10|Scene Context and Style:先交代场景和风格规则。原视频 17:13。

图 10|Scene Context and Style:先交代场景和风格规则。原视频 17:13。

模块二:当前参考素材

为每份输入明确分工:哪张是出租车,哪张是司机,哪张提供场景,哪个视频控制镜头和动作。

视频口述建议,把视觉外观主要交给图像输入;但屏幕中的示例仍包含一定的外观识别文字。实际使用时,可保留必要的身份说明和状态说明,避免重复描述引入与参考图冲突的新设计。

图 11|Active References:逐项说明参考素材的身份与用途。原视频 17:35。

图 11|Active References:逐项说明参考素材的身份与用途。原视频 17:35。

“与参考图完全一致”可以写成目标,但不等于模型一定能做到。后续仍需检查。

模块三:镜头结构与动作节拍

说明每个镜头的构图、第一帧、动作顺序和持续时间。若包含切镜,要写清楚切在哪里;若要求连续镜头,也要明确表达。

图 12|Shot Structure:示例分别描述相机、首帧与带时间的动作节拍。原视频 18:00。

图 12|Shot Structure:示例分别描述相机、首帧与带时间的动作节拍。原视频 18:00。

模块四:固定条件与约束

写清不能被改变的条件,例如人物留在原来的座位、车辆的损坏状态保持一致、不新增乘客、不擅自切换机位。视频团队还经常要求只生成场景音效、不添加音乐,便于后期处理。

模块五:动画原则

视频把挤压拉伸、预备动作、跟随动作等动画原则放进独立模块,并提出运用于镜头的要求。讲者也明确承认,模型并不能稳定遵守全部要求,但这些描述帮助团队接近目标动作。

图 13|动画原则被单独列入提示词,用于描述希望出现的运动特征。原视频 18:40。

图 13|动画原则被单独列入提示词,用于描述希望出现的运动特征。原视频 18:40。

更有用的写法,是把原则落到具体物体上:轮胎着地时压缩、车身落地后回弹、头发随惯性摆动。仅罗列术语,仍然无法说明这个镜头到底该怎样动。

视频还分享了“把重要信息放在提示词前部”的经验。文章保留这一实用建议,但不把其中“前 20%”的说法视为适用于所有模型的技术定律。

06 一份可以改写使用的镜头模板

以下是依据视频方法编写的中文练习模板,不是原片提示词全文,也未经实际生成验证。其中的时间划分是教学示例;使用时替换为自己的镜头长度与素材编号,并在平台里实际绑定对应参考。

【场景背景与风格】
公路上的出租车追逐镜头。主车和人物采用风格化 3D 造型,环境保留水彩绘画感。使用暖色低角度阳光,主体清楚,阴影方向一致。

【当前参考素材】
视频 A:仅参考动作顺序、相机运动和节奏,不复制简化模型的外观。
图 A:出租车最终设计。
图 B、图 C:两辆卡车的最终设计。
图 D、图 E:司机和女孩的最终角色设计。
图 F:公路环境及光照参考。

【镜头结构】
总长 7 秒,连续镜头,不切镜。
0—2 秒:出租车接近两辆卡车之间的缺口。
2—3 秒:车身侧倾至同侧两轮支撑。
3—5 秒:保持侧倾穿过缝隙,相机持续跟随。
5—7 秒:完全离开卡车后四轮落地,车身回弹并恢复稳定。

【固定条件与约束】
人物保持各自座位;角色服装与配饰以最终设定图为准。
不新增人物、车辆部件或镜头切换;保留车辆既定状态。
只生成场景音效,不添加音乐、对白、字幕或水印。

【动画原则】
侧倾前有清楚的预备动作;轮胎适度挤压拉伸。
落地表现车辆重量、悬挂回弹与惯性,动作夸张但顺序清楚。

写完后先检查输入之间是否打架。例如,提示词要求人物戴耳机,但构图参考图没有耳机,模型会收到互相冲突的信息。此时应先修正参考图。

07 三个真实问题,比成功案例更值得记住

问题一:灰模镜头太近,看不出空间关系

女孩靠近卡车门的镜头,已经有 Blender 动画参考,但生成效果仍然不对。团队发现,相机距离过近;缺少纹理和面部细节的预览,几乎被几块灰色形体占满。

创作者熟悉场景,知道这些形体是什么,但参考本身没有把关系解释清楚。团队回到 Blender,把相机拉远,展示更多环境后,下一次生成得到改善。

遇到类似问题:先检查人物、接触物体和周围空间是否同时可见,再决定是否改提示词。

问题二:为了稳定机位,参考图反而让耳机消失

女孩把两条安全带扣成 X 形的动作,早期测试成功过。换成最终角色设计后,相机角度开始不稳定。团队于是从构图正确的结果里截取图片,作为下一轮参考。

构图稳定了,耳机却持续消失。原因是:选中的构图截图本身就没有耳机,与角色设定图发生了冲突。

图 14|用来固定构图的截图缺少耳机,原视频用黄色圈线指出这一遗漏。原视频 24:40。

图 14|用来固定构图的截图缺少耳机,原视频用黄色圈线指出这一遗漏。原视频 24:40。

修正方法很直接:在 Photoshop 中把耳机画回截图,再使用修正后的版本。视频报告,下一次生成既保留了目标机位,也恢复了耳机。

图 15|在 Photoshop 中补回耳机,使构图参考与角色设定一致。原视频 24:58。

图 15|在 Photoshop 中补回耳机,使构图参考与角色设定一致。原视频 24:58。

遇到类似问题:不要只检查主角色图,也要检查那些为机位、动作或场景挑选的辅助参考图。

问题三:大动作做出来了,微妙表演仍未解决

团队计划了一个车内笑料:女孩抓住车顶拉手,拉手断了;她短暂停顿,意识到发生了什么,再抓另一个,结果又断了。

图 16|“连续扯断两个拉手”的分镜。该段表演在视频讲述时尚未解决,没有进入这段成片。原视频 25:19。

图 16|“连续扯断两个拉手”的分镜。该段表演在视频讲述时尚未解决,没有进入这段成片。原视频 25:19。

难点包括拉手的固定位置、断裂后的形态、握持关系,以及女孩反应中的那一下停顿。仅靠文字,团队没有得到合适的表演节拍;简单灰模又无法清楚传达表情和手部细节。继续增加预演细节后,生成结果又开始复制灰模造型,偏离最终角色设计。

这个案例提醒我们:镜头难度不能只按场面大小判断。在本次制作中,细腻的表演比部分大型追逐动作更难控制。这一问题在原视频中仍未解决,不能写成已经验证成功的流程。

08 把方法用到自己的第一段动画

下面的起步清单是基于视频经验整理的实践建议。

  1. 只选一个清楚的故事任务。先验证一个镜头里的一个动作,例如车辆绕过障碍。
  2. 准备最少但完整的资产。角色、核心道具、场景各有确定版本;反复出现的物件单独设定。
  3. 先做一次运动测试。检查纹理、光照、角色比例和配饰是否在运动中发生变化。
  4. 按控制需求选择路线。简单镜头直接生成;需要明确机位、时序或动作路径时加入预演。
  5. 用五个模块组织提示词。场景风格、参考素材、镜头结构、固定约束、动画原则。
  6. 按问题修改对应输入。外观问题查图像参考,动作问题查预演,规则遗漏查提示词。
  7. 保留可追溯版本。记录本次使用的图片、视频、提示词及修改原因,方便判断哪项变化带来改善。
  • 角色:发型、服装、配饰、人数是否保持一致?
  • 道具:车体结构、轮子和损坏状态是否前后一致?
  • 动作:先后顺序、接触关系、落地时机是否清楚?
  • 镜头:机位、跟随方向、切镜是否符合设计?
  • 画风:主体纹理是否稳定,环境与角色是否协调?
  • 光照与声音:光源和阴影方向是否一致,是否出现不需要的音乐或对白?

先让这一轮输入、生成、检查、修改能够顺畅完成,再把同样的方法扩展到更多镜头。


原视频回看索引

  • 02:25—04:10:前期制作、分镜和两条镜头路线
  • 04:10—10:05:资产优先、角色生成与手工修改
  • 10:05—11:55:场景风格、光照和前期测试
  • 11:55—15:25:出租车、其他道具与特效设计
  • 15:30—19:10:预演用途、提示词五模块与团队复用
  • 19:10—21:20:侧倾穿过卡车的完整镜头流程
  • 21:20—22:50:纹理、空车出现陌生人、光照三项测试经验
  • 22:50—27:15:灰模构图、耳机遗漏与未解决的表演难题
  • 27:15—28:05:制作回顾与后续完整拆解预告