跳到正文
Kwei 个人主页作品集 project library
跳到正文

vivix角色模型TVC

担任职务AIGC导演

把一个角色,拍成一段关系

这支片子由我担任导演,也是一次 AIGC 全流程的尝试。我想做的不只是把一个角色生成出来,再让它去不同的地方表演。从和客户讨论产品,到确定情绪、安排人物的回应,再到分镜、动态和修改,我一直在想:观众为什么会愿意和这个角色说第一句话,又为什么想继续和它相处?

这次工作也不是从一份写好的脚本直线推进。客户勾完场景,双方对展开程度的理解仍然不同;有些亲密动作看起来顺畅,却解释不清虚拟与现实的关系;有些图很好看,进入动态后又接不上。下面这些工作材料,记录的是我怎样发现和处理这些问题。

沿着工作过程阅读

先把创意变成可以讨论的选择

前期最容易发生的情况,是大家都在说“陪伴”“记忆”“互动”,脑海里却不是同一支片子。我把很多功能点写成生活里的片段:深夜有人陪你坐一会儿,运动时有人提醒你,游戏时有人和你拌嘴。场景有了具体的人物行为,客户才容易判断自己想要什么。

于是我们把沟通做成了一个 HTML 场景选择页。卡片上同时写出场景、功能、交互形式和预计时长,客户可以勾选,看到时长合计,再把结果导出成清单。比起在会议里逐个口头确认,这种方式留下了一个双方都能回看的选择结果。

前期沟通工具 · 场景选择页,图中为工具界面,并非客户最终选择

但选择完成,不代表沟通就完成了。客户回传了 17 个中间场景,按选择器的估算,加上开头和结尾约 112 秒,超过了原先约 100 秒的预期。更重要的是,客户以为选中的场景会按标注时长充分展开,而我在后续编排中,把一些内容收进了快速段落。双方都觉得自己说清楚了,实际想象的比重却不同。

这次分歧让我补上了一步:除了“要不要这个场景”,还要讲清楚“观众会在这里看见多少”。哪些需要完整的输入和回应,哪些只保留一个亲密动作,哪些只是身份变化的闪现,要放到时间线上分别判断。选择器帮助我们收集偏好,导演仍然要为每个选择安排位置和分量。

先想清楚,观众为什么愿意靠近她

面对大约 20—30 岁的年轻人,我想把“角色模型”放进亲密关系里去讲。外貌和性格可以被设定,但如果影片只停在“你想要什么,她就变成什么”,人物很容易变成一组漂亮展示。我更在意的是,有了这个角色以后,用户的状态会发生什么变化:有人听完你没说完的话,有人陪你再试一次,也有人在你得意的时候接一句玩笑。

我和 GPT 讨论过需求、被理解的感受,以及关系里的双向影响。不过这些讨论是帮我想清楚方向的,不该全部变成片中的旁白。我也几次把方案拉回来:共同成长可以藏在相处里,但不能压过这个产品最直接的吸引力——它可以和你交互,听懂你,并且给出一个有性格的回应。

人物是女性形象,也不意味着创意只向某一种性别的观众说话。我希望把镜头后的“你”尽量留给观看的人。比起一直交代一位明确的男主角,画外音、主观视线、一只伸出去的手,都能让人进入关系。它们也让后面那些不可能发生的场景,有了一个可以跟随的视角。

文字推敲到一定程度,还是需要画面。在团队讨论中,我们决定先用参考片段搭出粗略的时间线;我也把找到的亲密关系片段剪到一起,去看靠近、牵手、玩闹和安静相处之间的呼吸。这条剪辑不承担正式美术的任务,它的目的,是让情绪和节奏变成可以讨论的东西。

情绪参考剪辑 · 既有影像素材剪辑,非本项目成片

每一次回应,都要让观众看懂来由

亲密感不能把产品逻辑盖过去。早期我安排过咖啡和记忆的细节:角色知道你不加糖,看起来很自然,但讨论时我意识到一个问题——她在虚拟世界里,怎么把这杯咖啡递给真实的用户?这类小动作在普通爱情片里成立,放到角色模型的广告里,就可能让人误解产品。

还有一段照片与猫的设计。为了让画面流畅,输入动作被包进了故事里,客户却追问:这张照片是谁给的,和真实用户有什么关系?如果来源不清楚,观众只会看见 AI 变出了一只猫,而不一定看懂“它在回应我”。我需要先问清楚真实交互方式,再决定用什么镜头去表达,不能用一个漂亮的转场替代因果。

后面我把重点段落拆得更具体。健身房里,用户的动作有问题,角色看到以后打断,边讲边示范,用户再照着调整。音乐段要听见明确的换歌请求,而不只是突然换一首配乐。游戏里则用两个人拌嘴,把“她还没说完,用户已经插进来”的感觉做出来。每个功能都落在一个能被观看的行为里。

我没有要求每一场都变成操作教学。关键段落先建立“我做了什么,她怎样回应”的规则,其余画面才有空间去表现相处和情绪。UI 也服务于这个判断:需要它解释输入时就出现,已经能靠表演讲清楚的地方,就给人物留一点空间。这些是广告中的表达设计,不能当作产品实际性能或响应速度的测量。

亲密感,要细到一个眼神和一次停顿

AIGC 很容易给出一张漂亮的脸,但“这个人在和我相处”的感觉,要靠许多小决定累积。准备角色时,我曾觉得前期形象过于成熟,便要求把不同年龄感做成九宫格来比较,再继续讨论造型。人物参考确定后,我要求后续分镜沿用同一形象,服装、道具和场景也放在一起看,避免每张图都成立,连起来却像换了一个人。

我对表演的要求,也会尽量从情绪形容词变成动作。例如棒球比赛看台上的开心,我后来明确不要一个泛用的击掌,而是那种“居然赢了”的惊喜和不可思议。健身段也不能让她只站在旁边说一串指导词;我反复调整成:先看见错误,轻轻说一句“Wait”,坐到器械前,一边做一边讲。用户跟着改变之后,她再给一个确认的反应。

这些差别很小,却会改变人物关系。一直对镜头微笑,很容易像在展示自己;被对方的行为带动,才有共同经历的感觉。同样是一句游戏里的提醒,我要的是熟人之间的玩笑和接话,而不是客服式地把信息讲完整。所以台词会反复缩短、口语化,让句子能被打断,也让表情有时间发生。

飞书美术资产 · 人物、服装、道具和环境放在同一个参照里

这些要求在进入动态之前就要尽量明确。模型可以提供很多种表演,但我不能把“自然”全部交给它猜。我要先知道这一次靠近是主动还是犹豫,这一个回头在回应谁,这一场兴奋有没有超过人物本来的状态,再去判断生成结果是不是我要的。

分镜不只是一张图,还要告诉团队怎么动

前期提案和执行分镜,我会分开处理。提案里,客户先看剧情、情绪和产品点;到了镜头执行稿,就需要把机位、景别、运动、人物动作和前后接法写清楚。把两种文档混在一起,前者会难读,后者又往往不够细。HTML 在这里成为了一个可以不断补充画面和说明的工作载体。

我在历史沟通里反复追问过同一件事:

分镜阶段的一个要求

每个镜头,它是什么运动?它什么机位?它什么情绪?

比如健身房到游戏房的过渡,光写“环境切换”是不够的。前一场人物在画面左边,后一场在右边,摄影机往哪边走,什么时候经过眼睛的特写,到了下一场怎样接回 POV,都需要考虑。下一张图再漂亮,如果上一镜没有把运动方向交过去,观众仍会感觉突然断开。

AIGC 的执行还多了一层:这个镜头的任务会不会太多?一句对白、大幅动作、换装、环境转换一起发生,生成就更难控制。因此后续执行稿会拆开表演与转场,把复杂段落落实到静帧、动作节拍、遮挡和声音接点上,同时写出难以实现时的简化方式。导演想要什么,需要转成团队拿到以后可以开始做的动作。

高潮可以放大,关系不能在中间断掉

随着版本推进,后半段的任务也变了。最初很多生活场景承担“我们一起经历过”的感觉,后来我想让游戏段真正把人带进去:从房间进入赛车,再进入战地和其他世界。这样情绪可以更高,角色也不只是坐在旁边陪你玩,而是和你一起身处其中。

但我不想把这一段做成几个大场景的陈列。我会先给每一场找一个关系动作:开得太快时,她转过来提醒你;遇到危险时,你们会有慌张、调侃和互相拉一把的反应。讨论战地桥段时,我提出过把落到手里的手榴弹赶紧递给她,再用她的反应形成一个笑点。场面在变,观众跟着的仍是两个人的互动。

后来继续细化时,我又要求压缩战斗和太空段的剧情,把重心放回第一人称的运动和“游戏搭子”的感觉。每个世界都解释一遍,会拖慢广告;只有奇观,没有角色反应,又会把前面建立的亲密感丢掉。所以我在每一段里都要判断:哪些动作值得留下,哪些只是让场景更复杂。

这里的连续性,也未必都靠生成一个很长的镜头。可以让一只手、一个转头、一个方向相同的运动跨过剪辑点。执行稿里会讨论遮挡切、形状匹配和声音提前进入,让环境的变化有一个支点。把连接先想清楚,比不断追加更夸张的世界更有帮助。

有些画面,要先换一种做法

片头的粒子是一次很具体的试错。我希望观众随着声音穿过一片不断局部发光的空间,再走近人物的形成。最开始,我让 Codex 把参考片拆成序列帧,分析颗粒、闪烁和运镜,也尝试过用网页代码做粒子汇聚的人像。原型做出来后,我觉得它还没有抓到我要的空间感。

继续看参考时,我把要求说得更窄了:重点不是让所有粒子飞向一张脸,而是摄影机穿过有深度的神经网络,光在局部发生变化。为了看清这个区别,我要求逐帧拆,而不只是每隔一段时间抽一张图。前后景怎样掠过、哪些结构在闪、镜头怎么前进,这些都要分别看。

之后我们尝试了 Blender 白膜:先固定空间和摄影机,把材质与光效留给后续迁移。项目里也保留了另一条参考运动复刻测试,我要求先研究清楚运动,再讨论打乱和重组。两条测试解决的问题不同:一条尝试建立自己的空间,另一条先研究参考的运动,后面还需要重新组织自己的画面。

在后续的参考运动测试里,我继续逐项调:旧工程先保存;粒子不够,就增加成簇的结构,不能随意撒点;脉冲已经合适,就保留,只给镜头增加一点下摇。这种小步调整能让我知道,究竟是哪一个变化让画面更接近目标。

这些材料是项目中的技术探索,不代表每条路线都进入了最终片头。对我来说,它们留下了一种很实用的处理方式:当提示词无法同时管住所有东西,就把镜头拆成几个可以单独判断的部分,换工具解决其中最不稳定的一项。

让团队讨论同一张画面,也讨论同一条修改

制作展开以后,我把美术资产和镜头结果放进飞书看板。人物在哪些场景里穿什么、道具是否一致、这一镜对应哪个 cut、相邻镜头的造型有没有接上,都可以放在一张板上看。HTML 负责把剧情与执行要求说清楚,看板则把分散生成的结果重新放回影片的位置。

并行生成确实可以加快素材准备,但汇总不能只检查图片有没有补齐。我会要求逐镜核对人物一致性、方向和接法;正在补图的部分和已经能看的部分分开推进,先把已有结果贴进文档审一轮。这样问题可以在过程中被看见,不必等所有镜头都做完才发现理解偏了。

飞书镜头看板 · 让分散的制作结果回到同一条影片里

比素材归类更需要小心的是修改意见。一次会议里,有些话是必须调整,有些只是现场试想,还有些已经讨论过、决定不动。如果把它们一起写进执行表,团队会做出很多没有必要的新东西。我在后期明确要求:先把两场会议的意见对照起来,列清楚到底动哪里,再去改分镜。

这也包括检查 AI 整理出的内容。历史资料里,一版修改总表把一些讨论扩展成了精确时长和完整场景,后来的审计又把这些数字和情节收回到“建议”或“待确认”。这件事提醒我,整理得很完整不等于整理得准确。自动化可以替我展开和归类,但哪些是客户决定、哪些是执行设想,仍然要回到原话核对。

已经成立的部分要保留,被明确删掉的部分不要换个名字再加回来。这是我在整个项目中反复强调的边界。每一版都应该解决一个更明确的问题,而不是为了看起来有新变化,把前面确认过的语气、场景和节奏一起改掉。

最后,还是要回到整支影片里判断

到 BCopy 阶段,我让 Codex 把当时交给客户的影片重新拆开,去看每个画面是什么、剪辑点在哪里、各占多长。这样讨论“前面拖了”“后面需要更兴奋”,才有具体位置。资料里也保留了对旧版镜头拆分的复核:形变不一定是硬切,闪白不一定是新镜头。数字只有对应到真正的画面,才对修改有用。

时长怎么压,也要跟着情绪一起判断。不能所有地方都更快,否则触摸、停顿和眼神还没被感受到,画面就已经过去了。我希望音乐有松有紧,有变奏,能把亲密的前段带到游戏的高潮。为此我也让 Codex 整理过音乐方向的提示词,准备做试抽。音乐合不合适,仍然要放回剪辑里听,不能只看一组 BPM 或一份节奏表。

结尾我来回推敲过很久。雨声和初识的记忆,是我希望保留的连接;客户觉得还缺少收尾感时,我也没有想把这段情绪全部换掉,而是继续找一句更自然的邀请。经历那么多变化以后,最后仍然要回到这个人:她能怎样理解你,你愿不愿意继续和她说话。

回到这次全流程尝试,我觉得最值得留下的是一套能反复使用的工作方法:先用可见的材料对齐想象,再用具体的动作检验创意;工具做不到时拆开问题,版本变多时守住已确认的部分。客户沟通、导演判断和 AIGC 制作没有被分成几段互不相干的工作,它们一直在相互校正。最后交出去的,也应该是一支在情绪和表达上都连得起来的影片。

制作方式与工具

创意梳理与脚本协作 · ChatGPT / Codex

客户沟通 · HTML 场景选择页与提案

情绪预演 · 参考影像剪辑

镜头执行 · HTML 分镜、动作与转场工作稿

视觉实验 · 网页粒子原型 / Blender 空间白膜

团队协作 · 飞书美术资产与镜头看板

版本复核 · 会议对照、逐镜拆解与修改清单