读大羽的《带你去玩球!》技术白皮书,我最想继续聊的,是一颗网球怎样影响了后面的制作:狗为什么出门,镜头为什么要从球抬到主人的脸,最后又为什么要在主人头顶留出放小太阳的位置。情绪、构图和工具,在这里是接着往下走的。
大羽写到,这部短片在2026年3月集中制作了约15天,分镜图片接近200张。这个规模当然不轻松,但我读下来更在意的,是他怎样分配精力:有些镜头反复修图,有些直接交给多参考生成,有些效果则拆开交给后期。这篇就沿着几处具体选择,整理我的理解。
01 / 一颗球球先有了意义,镜头才知道往哪里去
故事的起点来自大羽外出参赛、家里的狗独自等他回来。这段经历里有思念,也有愧疚,但这些感受还不能直接变成一颗镜头。他后来做了一次很有意思的视角转换:在人看来,是主人陪狗玩球;可在狗的理解里,也许是主人喜欢球,自己叼来球,是想让主人开心。
球把“想让你开心”变成了一个能看见、能追逐、也能保护的目标。 于是狗对球的执着就有了情感上的理由。白皮书提到结尾保护球不被车碾压的设计,危险落在一个具体物件上,观众也就有了可以跟随的行动。
这也是我觉得值得学习的创意处理。一个故事即使从很私人的情绪出发,也需要找到能承载它的动作和物件。大羽没有让狗用复杂的语言解释爱,而是让它围着球行动。片名里的“你”既可以指狗,也可以指主人,两种理解从同一个日常动作里长出来。
前期讨论中,AI还给过一些更奇幻的点子,大羽最终选择了相对写实的方向,保留娃娃机这类贴近日常的想象。我理解,这个取舍让故事里的异常仍然贴着狗的感受,没有把每个场景都变成一次视觉奇观。
02 / 空间关系卧室和客厅,首先要能互相看见
第一场戏里,狗躲在卧室床底,要能偷偷看到客厅里的主人。这给场景资产提出了很明确的要求:床、门、客厅不能各自好看就算完成,它们得让这条视线成立。结尾马路和公园的关系也一样,狗保护好球之后,要能感受到主人就在附近。
大羽先用 Midjourney 建立场景的布局与影调,再用 nano banana 调整细节。涉及连续空间时,他试过图像转3D,也试过传统3D白模。按他的描述,前者的视角变化后细节还不够,后者的时间成本超过他能接受的范围,最后主要依靠逐步修图推进。
其中一个尝试是把俯视调度图、卧室图和客厅图一起交给模型,让它按位置关系推理新视角。结果连接出了需要的空间,但门的比例仍然有问题,大羽也说明这个办法并非每次有效。调度图补充的是“哪里通向哪里”的信息,画面出来以后,尺度与透视仍要逐项检查。
把位置关系也放进参考点图放大 ↗
左上是俯视调度图,下面两张图提供卧室与客厅的样貌;右侧尝试把位置和外观结合起来。空间连接出来了,门的尺度仍需调整。这里的启发很实用:做资产之前,可以先把这场戏的视线画出来。观众要从床底看到谁,出门后会到哪里,下一镜为什么会出现公园。把这些关系放进参考,比到剪辑时才发现两个漂亮场景接不上,要早解决一步。
03 / 分镜制作多出来的窗户,可以通过换景别解决
狗从窗户探头的镜头,大羽先让狗进入窗户,再调整机位。过程中出现了一个小问题:前面已经交代这是一扇独立窗户,新图却在墙上长出了更多窗户。
一种改法是逐个擦掉。但大羽考虑到删完后墙面会过空,最后选择收紧景别,让多余窗户离开画面。这个决定同时处理了连续性和构图。只要狗探头、向下看的信息还在,就没有必要执着于保住最初那张图的全部内容。
保安吓到狗的低机位全景,顺序又反了过来:先定场景与视角,再画人物站位草图,最后把保安、狗和构图参考一起交给模型。两个案例放在一起看,就能发现分镜制作并不存在一套处处适用的操作顺序。
先固定最难移动、又最影响镜头意思的部分。 我的理解是,这两次制作都先解决了最影响构图的部分,再处理余下内容。模型连续几次都改不对时,值得检查一下,自己是不是把制作顺序定得太死。
先有机位和站位,再把角色放进去点图放大 ↗
先在场景上画出站位,再加入保安与狗的形象。草图负责位置,角色参考负责长相和服装。04 / 镜头控制该锁住什么,要看这颗镜头负责讲什么
白皮书里同时用了图生视频、首尾帧和多参考。放回具体镜头,就能理解为什么要换方法:不同镜头需要稳定下来的部分,并不相同。
结尾从地上的球抬头看向主人,是狗的主观视角。大羽还准备在主人头顶合成小太阳,因此结束画面的构图必须准确。他分别制作首帧和尾帧,用这两个已确定的位置约束生成。前面球的情感含义,到这里变成了机位、运动方向和合成空间。
另一颗长镜头里,狗经过自家楼下,朝楼道望去,短暂停留,然后继续走。需要传达的是一段连续行动。大羽用全景、关键构图和角色资产作为参考,再描述调度。我的理解是,这类镜头需要把动作之间的关系讲清楚,起点和终点两张静帧本身并不能交代中间的犹豫。
球到主人:先确定两个画面点图放大 ↗
起幅是地上的球,落幅是主人。主人的位置与头顶空间,要为后面合成的小太阳留好。三类镜头的控制重点| 镜头 | 优先控制 | 片中的做法 |
|---|
| 人物近景 | 表情是否符合情绪 | 图生视频,比较不同生成结果中的表演 |
|---|
| 球 → 主人脸 | 起落画面与头顶留白 | 准备首尾帧,再检查中间运动 |
|---|
| 路过家门继续走 | 场景连贯与动作衔接 | 给多参考和调度描述,检查整段行动 |
|---|
这些是这部片子的制作选择,不能当成固定的模型排名。对自己的镜头,可以先写一句验收要求:是表情、落幅,还是连续调度最不能出错。这样再选生成方式,才知道一条结果好在哪里,又该因为什么被舍弃。
05 / 八种背景锁住狗头的穿街镜头,分五步完成
穿街走巷的段落需要狗头始终固定在画面里,背景连续变化,光影又要随环境改变。把这些要求一次写进提示词,等于要求模型同时协调动作、视点、换景节奏和光线。大羽将它拆成了几段工作。
先生成一段正常奔跑的视频,用跟踪和稳定把狗头固定下来。稳定会让原画面相对移动,边缘可能露空,再用视频编辑补齐背景。得到一段可用的基础视频后,保留狗的主体,分别替换出8种背景,最后在剪辑时间线上按节奏切换。
同一段动作,派生不同背景点图放大 ↗
左侧共用一段奔跑视频,右侧替换环境。这里展示部分版本,整个段落共制作了8种背景。锁定狗头 / 依次点开五个制作环节
01 / 确定动作
先得到一段正常奔跑的视频。后续不同场景都沿用这一段动作,避免每个背景重新生成一套步态。
01 / 05
最后一轮控制,在剪辑时间线上点图放大 ↗
把不同背景的版本对齐,在选定的时间点切换。背景变化的节奏,由时间线决定。这套拆法把“一致性”变成了可以复用的条件:先有共同动作,再做环境变化。 如果每到一条街都从头生成狗跑步,步态和位置就会多出一组需要对齐的变量。共享基础视频,让后面的工作集中到换景和节奏上。
它也提醒我,AI效果可以借助常规后期来完成。跟踪稳定负责视点,视频编辑处理画幅与环境,剪辑决定切换。若照着做,仍要检查补边有没有扭曲、主体有没有被改动,以及换景时的色光是否突兀;流程明确,不代表每个生成结果都能直接用。
06 / 回到剪辑有些控制,放在剪辑里更合适
动画追逐和打戏采用了另一种办法。大羽先给故事框架,让模型生成带有分镜变化的片段,再把结果拆成单镜头,按功能整理:用于开场的、发动攻击的、表现失败的。每一类里又有不同动作,可以重新组合。
在这些段落里,他需要的是快速的运动和情绪积累,于是将部分构图与调度交给生成,把镜头顺序、长短和衔接留在剪辑台上选择。这种方式适合目标明确、允许多种表现的段落;若某个动作必须交代清楚道具位置或因果,仍需要更严的逐镜控制。
代价也很具体:素材会被拆成大量几帧到一秒的碎片。大羽提到,一旦制作思路中断,很容易在这些片段里失去方向。我会把这个经验落实为一个整理习惯:先按镜头在场景中的用途分组,再从组里选素材。仅按“最好看”“第二好看”排序,接起来未必是一场戏。
近两百张分镜图片,并不是全部完成后才开始生视频。大羽按场次,甚至按单个镜头交错推进生图、生视频和剪辑。技术做不到时改分镜,新想法出现时调整方案,接起来不顺时补镜头。这样反馈发生在一场戏还来得及修改的时候。
最后也不能把整部片子简化成模型产出。跟踪、合成、调色、转场和声音设计都参与了完成;编曲与混音还有音乐人朋友协助。头顶的小太阳要跟着人物,狗跑过不同地方也要有相应的环境声。画面生成结束,只完成了观众体验的一部分。
07 / 总结我想带回自己工作流的三件事
这篇白皮书让我更清楚地看到,故事意图可以具体到制作的每一步。球承载什么情绪,决定了它要被怎样保护;狗要看见主人,决定了房间的连接;主人头顶要出现太阳,决定了镜头落幅;动作需要一致,决定了八个背景共用一段视频。
给镜头写清要交代的信息动作、视线、物件或情绪,先确定观众需要看见哪一项。参考图和提示词围绕它准备。
把复杂效果拆成可检查的步骤像锁定狗头那样,把动作、视点、补边、换景和节奏分别处理,每步都能检查哪里出了问题。
尽早剪出一场戏让图与视频进入时间线,根据实际衔接决定返工,把精修留给确定会使用的镜头。
实际开工时,我会先拿一场短戏试这套顺序:写出每颗镜头的用途,完成足够判断关系的素材,剪出一版,再列需要补做的部分。这样下一轮生成就有了明确去处,也能减少在最终会删掉的画面上反复打磨。