跳到正文
Kwei 个人主页作品集 project library

FILM ESSAY / 从实拍到 AIGC

从实拍到 AIGC:当画面不必被拍摄,我们还要创造什么

从诺兰的走廊、斯皮尔伯格的恐龙,到《牌子》和《带你去玩球!》:当画面越来越容易获得,创作者如何继续观察、选择,并完成一部值得被看见的作品。

约 57 分钟阅读15,690 字
《星际穿越》(2014)。前景船体为远处的黑洞提供了尺度;这幅无法由剧组实地拍到的景象,来自计算与电影制作的合作。DNEG
本文目录20

01一扇窗,两种抵达的方法

设想一个很小的镜头:傍晚,一个人站在窗边,听见楼下有人喊他的名字。他已经抬起手,最后却没有推开窗。

如果要把它拍下来,首先得找到一扇合适的窗。窗外不能太吵,玻璃的反光不能挡住脸,屋内和屋外的亮度要能容纳在同一个画面里。演员的手抬到哪里,停多久,楼下的声音什么时候进来,都需要商量。有时天暗得比预想快,刚才那种光已经回不来了。有时演员在迟疑中多停了半秒,原本写在纸上的情绪突然有了一个更准确的形状。

用 AIGC 制作,最先遇到的困难可能完全不同。窗、夕阳、人物和屋内的陈设很快就齐了,甚至比预想的漂亮。但人物为什么停住,手与窗框是什么关系,下一镜从楼下回望时还是不是这扇窗,未必一起成立。制作的时间从寻找场地、调灯、排练,挪到了准备参考、约束动作、筛选结果和修正连续性上。

两种方法都可能把这个镜头做好,也都可能做坏。实拍会失焦,表演会过火,生成会变形,修改会误伤。把一方想成有灵魂的手工,把另一方想成没有灵魂的按钮,对实际创作都没有多少帮助。我更想顺着这扇窗往下想:当画面越来越容易出现,我们究竟把哪些工作交出去了,又把哪些决定留给了自己?

我对 AIGC 的期待里,有一种很朴素的愿望:一个人不必先拥有很大的预算,才有资格试着讲一个复杂的故事。外星城市、记忆中的老房子、梦里走不完的楼梯,都可以先成为看得见的东西。许多过去停在笔记本里的念头,终于有了试错的机会。

但获得画面,和获得表达之间,还有一段相当长的路。模型可以给窗外加上落日,不能替这部作品决定那个人为什么不愿回应楼下的呼喊。这个决定需要人物的处境、故事的前因,以及创作者对人的理解。技术把某些门打开以后,我们仍然得自己走进去。

下面这篇长文,就从这件小事出发。我会谈诺兰和斯皮尔伯格,也会谈 AI 短片、视频模型、平台和那些不太显眼的后期工作。我关心的是一部作品如何被做出来,及其制作方式改变之后,人和世界的关系会怎样变化。

02诺兰的走廊,为什么值得重新看

谈实拍,人们很容易想到诺兰。《盗梦空间》的旋转走廊尤其适合拿来讨论:空间翻转,人物失去稳定的上下方向,原本普通的酒店走道变成一种身体难以适应的环境。在 ASC 的主创报道里,能看到沿长轴旋转的走廊布景,也有另一套竖直搭建、配合吊线工作的走廊。这个场景的说服力,和人在一个会转动的空间里如何站立、摔倒、抓住支点有关。

这里值得学习的,是他把故事中的规则落实到了演员能够遭遇的条件上。脚下的地面一旦开始旋转,身体就得做出反应。重心转移不是一个写在提示词里的形容词,它会牵动肩膀、膝盖和呼吸。摄影机再去选择如何观看这场反应,观众才有机会感到失重的危险。

当然,不能因此把《盗梦空间》讲成一部没有数字特效的电影。现实布景、威亚处理、数字环境和合成可以在一部作品中合作。“尽量把什么放到现场”是一种制作判断,并不等于必须排除所有后期工具。拿诺兰证明某一种技术永远优越,反而会漏掉他对不同手段的选择。

如果今天用生成模型做同样的任务,容易先得到的是一幅倒置空间中的打斗画面。需要检验的部分很细:角色在墙上获得了什么支撑,离开支撑后运动如何延续,镜头转换以后重力方向是否还能被理解。画面表面的剧烈运动,可能掩盖动作关系的含混。看起来很忙,不一定意味着观众知道危险发生在哪里。

这也解释了为什么学习实拍仍然对 AIGC 有用。不是每个人都要搭建旋转走廊,但可以先拿手机拍一个人从椅子上站起,看看身体如何先前倾,再把重量交给脚。这样的观察会改变我们写动作、画分镜和判断生成结果的方式。一个模型生成的身体有没有重量,最终仍要靠对身体的了解去看。

《星际穿越》把这种关系带到了无法实拍的地方。DNEG 对黑洞渲染的说明介绍了团队与 Kip Thorne 的合作,光线如何弯曲,需要由计算处理。飞船的制作又同时使用了微缩模型、全尺寸道具与数字模型。一部电影内部就有多种现实与计算的交接。

看这张飞船与黑洞的画面,前景的船体给远处的光提供了尺度。船壳的曲面、阴影与远处强光,让“我们正在靠近什么”变成一个可以感受的位置关系。黑洞无法被剧组实际抵达,电影仍然可以借计算为它建立规则。今天的生成模型也能提供这样的景象,但如果作品需要可验证的物理关系,画面相似还不能替代相应的验证。

03斯皮尔伯格的恐龙,先存在于人的反应里

《侏罗纪公园》提供了另一种很好的参照。按 ILM 的制作回顾,Stan Winston 团队的机械恐龙与 ILM 的数字恐龙,在不同镜头中接力完成了同一个角色。观众在观看时,通常不会按照制作部门把恐龙切成几种类别。他们关心的是它有没有看见人,以及人还能往哪里逃。

我想把注意力从恐龙本身移开一会儿。一个巨大的生物要进入叙事,需要比“做得逼真”更多的安排:人物先看见什么,谁先意识到危险,空间里有哪些遮挡,声音从画外的哪个方向传来。反应镜头、等待和视线,为一个尚未充分露面的对象准备了位置。特效进入这个位置,才能变成戏的一部分。

配图中,实拍人物位于画面下方,腕龙占据树木之间的大块空间。人物背对观众,一起朝向它,观众也顺着这个姿态进入画面。人的尺寸、树的高度与恐龙身体形成了对照,不需要旁白报出数字,体量已经可以被理解。

《侏罗纪公园》(1993)。人的尺寸、朝向与树木一起,帮助观众理解恐龙的体量。ILM / Universal

这对 AI 视频的提醒很直接。生成一只皮肤细节丰富的怪物,如今已经是一项可以反复尝试的画面任务。让观众害怕它,需要另一组决定。主角是否听见了动静,为什么没有立即离开,观众知道的是否比角色多一点,逃跑的路径是否早已被交代。这些关系不能靠提高分辨率补回来。

也不能把斯皮尔伯格的工作概括成“会讲故事”就结束。讲故事落实到镜头里,是信息分配的手艺。先给一个空位置,再让某种东西占据它;先让人以为安全,再让声音破坏这种安全;让观众看清出口,也看清出口为什么暂时到不了。这里的每一步,都可以在没有昂贵特效的情况下成立。

生成模型会降低奇观的制作门槛,这是一件好事。只是奇观的稀缺性下降之后,等待的安排可能变得更重要。满屏巨物彼此竞争,很容易把所有镜头推向同一种强度。一个人屏住呼吸、没有立刻逃走的几秒,有时反而能让画面重新获得尺度。观众需要靠近角色,才能知道巨大究竟有多大。

把诺兰的走廊和斯皮尔伯格的恐龙放在一起,我看到一条适合延续的工作经验:先让动作、空间和观看顺序成立,再考虑用什么办法把它们实现。今天可以把这些判断交给实拍、三维、合成或生成模型中的任何一种。判断本身仍然值得认真学习。

04被拍到,与被生成,究竟差在哪里

如果一张生成图足以乱真,它和照片还有区别吗?从最终显示的像素看,有时确实很难分辨。但从图像如何到来这件事看,两者仍然有不同的关系。

摄影需要某种光在某一时刻进入镜头。即使被拍摄的是布景、替身和一段虚构表演,仍然有一些东西在那个现场共同出现过。照片不能自动证明故事是真的,却保留了它与一次具体发生之间的联系。片场搭出了一条街,也确实有人在那条街上走过;演员假装悲伤,那个假装的动作仍然发生在他的身体上。

生成图像没有这样的必要条件。它可以依据文字、参考画面和模型中学到的规律,形成一个从未被镜头记录过的场景。一个孩子站在一栋不存在的房子前,屋檐上的水痕和衣服上的皱褶都很可信,但不必有这样一个孩子曾经站在那里。生成给了想象更直接的可见性,也让画面的来历需要重新说明。

这并不使生成影像天然低一等。小说中的房子也未必存在,动画中的角色也没有在现实里表演过。艺术从来允许虚构。值得分清的是,我们在什么场合向观众提出了什么承诺。一部幻想短片邀请观众进入一个世界;一段声称记录某次真实事件的视频,则要求观众相信世界曾经如此。这两种承诺不能随意交换。

摄影也没有因此获得免检资格。镜头可以选择角度,剪辑可以省略前因,配乐可以诱导感受。即使每一帧都来自现场,整体叙述仍可能误导。与其寻找一种永远诚实的技术,不如把诚实落实到可检查的做法:哪些部分是记录,哪些是重建,哪些经过生成,作品是否让观众理解这些差别。

对创作者而言,还有一层更私人但同样重要的变化。实拍常常要求我们去到某处,跟某个人见面,接受对方的迟疑、疲惫、拒绝和意外表现。生成可以缩短这段过程,让很多事情在自己的房间里完成。效率提高了,与他人相遇的机会却不会自动保留。

我担心的,是我们在获得制造画面的能力以后,逐渐减少了观察真实世界的耐心。一个人可以越来越熟悉“生活感”这个词,却越来越少注意生活中的人如何说话。技术当然没有禁止我们出门。但当每个需求都能先获得一个看起来合理的答案,继续去看、去听、去核实,就会变成需要主动做出的选择。

镜头怎样抵达观众把工作放在不同的位置
实拍从现场出发
  1. 布置与排练空间、光线、动作
  2. 记录一次发生拍摄、收声、现场选择
  3. 剪辑与完成取舍、合成、声音
生成从条件出发
  1. 准备参考人物、场景、动作关系
  2. 生成与修正筛选、约束、局部修改
  3. 剪辑与完成连续性、节奏、声音
混合按镜头分工
  1. 留下真实表演身体、呼吸、现场声音
  2. 拓展画面生成、三维、合成协作
  3. 让整场戏成立检查、调整、交付

三种路径都需要人判断。箭头只表示主要衔接,实际制作往往来回修改。

05模型怎样把条件变成画面

理解生成模型,不需要先把自己变成算法工程师。不过有几个概念,确实会影响创作判断。先从训练开始:模型接触大量样本,在训练目标的约束下调整参数,逐步学会数据中可利用的规律。人物如何出现在画面里,动作怎样随时间变化,语言描述和视觉内容如何对应,都可能成为学习的对象。

这不等于模型在内部存放了一套能够逐件取出的真实道具,也不能笼统地说每次生成都只是把数据库中的几个片段剪贴起来。参数承载的是学习得到的统计结构;已有图像扩散模型研究也发现了训练样本被记忆并在特定条件下复现的现象,不能因为生成具有组合能力就排除这种可能。把它神秘化成独立生活过的导演,或者简化成绝无新组合能力的素材搜索,都不足以解释实际现象。

潜空间可以理解为一种适合模型处理的压缩表示。图像或视频里的信息被转换到另一种表示中,再由解码器转回可见画面。它不是把所有人物分门别类摆放的仓库,更不是一处能直接走进去拍摄的三维场景。相关方法的一个实际动机,是降低在高分辨率像素上直接训练和生成的计算负担。潜空间扩散论文讨论的正是这种表示与计算之间的取舍。

DiT 则是处理这些表示的一类网络结构。它使用 Transformer 处理潜变量分块,让不同位置的信息可以参与彼此的计算。原始 DiT 论文研究的是图像生成,后来的视频模型会在时间维度和条件输入上继续设计。听见 DiT 这个名字,不能就推断两个视频模型具有同样的能力,更不能据此认定它们内部拥有完整的物理世界。

以扩散这一类方法为例,生成可以粗略理解为在条件引导下,经过多步计算,从噪声走向有结构的样本。实际系统也可能使用流匹配、不同采样方法或其他设计。对创作者最有用的一点是:生成不是摄影机在隐藏的片场里重新拍了一遍。因此,修改一句话,有时会连带改变许多原本没有要求修改的细节。

当我们说“只把这个人转向左边,其他都不要变”,人类同事可以借助对场景和任务的理解尽量保护其余部分。模型能保护多少,要看系统提供了哪些约束、训练是否支持这种编辑,以及具体样本是否处在它擅长的范围。提示词写得明确有帮助,但写得明确与结果一定服从之间,始终需要实际验证。

理解这些概念以后,很多挫败会变得容易处理。它没有按照要求保留衣服上的标记,未必是自己不够会写一句“咒语”。问题也可能出在参考输入不足、编辑能力的边界,或者当前模型对这项任务的表达能力上。知道困难落在哪里,比给失败附会一个玄妙理由有用得多。

06画面会流动,不等于世界已经建好

视频生成最令人兴奋的地方之一,是我们开始看见一个虚构场景连续变化。摄影机可以绕过桌子,人可以走进门,光线可以随着时间移动。这很容易让人产生一种感觉:门后应该还有房间,人物离开画面以后应该还在继续生活,只要把镜头转过去,就能接着拍。

这种期待非常迷人,也需要认真区分。一个系统生成了视觉上连续的画面,不等于它一定维持着可查询、可修改、长期稳定的场景状态。桌上的杯子有没有被拿走,门后有几级台阶,人物在另一面墙后的确切位置,都可能只是当前镜头里看似合理的延续。除非具体系统提供了相应机制,否则我们不能把想象中的完整世界,当成已经存在的制作资产。

OpenAI 在 2024 年的视频生成研究说明中讨论过这种模拟潜力,也列出了物理交互、物体状态和长时一致性的限制。这份材料提供的是一个研究方向,不能拿来证明所有后续模型已经解决了世界模拟。每一代系统都应该接受新的检验,早期失败也不能被当成未来永远不可能成功的证据。

我愿意给“世界已经建好”设一个更接近拍片的检验:先在房间里拍一个全景,再走到门外拍反打,最后回到原来位置。期间让一个人把杯子移到另一张桌子上。回到室内时,杯子的位置应当延续,人物应当记得已经发生的动作,墙和门也不能为了新构图随意改建。这比单个镜头里出现漂亮的镜头运动,更接近持续拍摄一个场景的需要。

研究者也在用更受控的任务检验视频模型。关于物理规律泛化的研究把已见条件和未见条件分开,考察模型是否能把规律带到新的情境。它对我最有价值的提醒,是相似样本上的成功与跨条件的可靠性应该分别观察。一部作品可能恰好避开了薄弱处,这可以是聪明的制作选择,却不是模型已经无所不能的证明。

未来如果模型能长期保存物体、空间、动作与因果状态,创作会发生更深的变化。我们可以在同一场景里持续调度,修改人物行动,反复寻找视角,而不必每次重新请求一个近似的世界。那时,生成与虚拟制作之间会出现更多连接。这里写的是我期待的方向,距离它有多远,应当由可复现的作品流程来回答。

07一颗球,比一座生成的城市更难替代

回到已经能够读到制作过程的作品。大羽的《带你去玩球!》让我感兴趣的,首先是一个很小的视角转换:人在想陪狗玩球,狗却可能以为主人喜欢球,于是叼来球,是为了让主人开心。球因此有了情感上的用途,随后才有追逐、寻找和保护它的动作。

这个构思来自他的生活经验。按创作白皮书里的叙述,外出参赛与狗独自在家的处境,是故事起点的一部分。恰恰因为这颗球属于某一个人的生活,片子才有一个不容易被通用提示词替代的起点。

《带你去玩球!》。一颗球承载了狗对主人的情感理解,动作因此有了理由。大羽玩AI

白皮书里有个很实在的空间问题:狗躲在卧室床底,要能看到客厅里的主人。因此床、门和客厅不能分别生成得好看就算完成,它们必须容纳这条视线。大羽尝试用俯视调度图和场景参考帮助模型处理连接关系,得到了一些可用结果,也遇到比例不对的情况。图像生成确实省去了搭出整个房子的过程,房子内部的关系仍然需要有人负责。

另一处选择更能说明创作者在做什么。窗边镜头里出现了多余的窗户,如果只把问题理解成“擦掉错误”,就容易陷在修图里。大羽改了景别,让多余部分离开画面。镜头保留了狗探头的动作,也重新获得了构图上的完整。一个错误在这里促成了导演判断,而不只是一次模型参数调整。

这些具体过程,比“某某模型让普通人也能拍大片”更有解释力。普通人确实可能获得新的制作能力,但一部作品能完成,靠的是不断确认哪些部分必须准确、哪些部分可以改写。故事要求狗看见主人,那么视线就是硬条件;故事并不要求那面墙以最初版本完整出现,墙就可以退让。

奔跑段落把这种选择做得更清楚。按大羽的记录,他先生成正常奔跑的片段,再跟踪并稳定狗头的位置,补齐稳定后露出的画面缺口,然后从同一段基础视频派生出八种背景,按节奏拼接。八次独立生成,可能带来八套不容易对齐的动作;先保住共同动作再换环境,则把一部分连续性提前固定下来。这里的效率来自流程设计,不能只归功于模型生成得快。

奔跑段落的时间线。先保住共同动作,再派生背景,连续性的一部分在生成之前就被固定下来。大羽玩AI

这让我对个人表达的未来保留了相当多的期待。模型能够制造无数种小狗,不能替某个创作者决定他怎样理解自己与狗的关系。技术越容易得到相近的视觉质量,生活里那些很小、很具体、略带偏心的观察,越值得认真保留下来。它们不保证作品一定成功,但会让作品有一个明确的出发地点。

08《牌子》提醒我,制作可以继续越过工具的名字

DiDi_OK 在 2026 年 2 月发布的《牌子》,设定了一个有趣的麻烦:生活里出现的荒诞路牌,会把牌子上的内容变成现实。一个平常用来提示人的符号,开始直接规定人所处的世界。这个设定给不断出现的奇观提供了共同规则,观众可以随着规则产生的后果往下看。

《牌子》。熟悉的路牌成为荒诞规则的入口。DiDi_OK / FoST未来叙事导演访谈

FoST 未来叙事的导演采访中,DiDi_OK 提到 Google Map 镜头混用了录屏、AI 与后期;文字消失的效果也需要传统绑定处理。随采访刊出的书页画面,则能看到 Mocha Pro 的网格跟踪。屏幕上那些点和线很不起眼,却直接表明有人在处理运动与表面的关系。生成输出不是终点,它还要与已有画面贴合、随物体运动,并在剪辑里保持可信。

《牌子》的书页跟踪。网格把效果与会运动的表面联系起来;画面生成之后,传统后期仍在工作。DiDi_OK / FoST未来叙事导演访谈

这对“从实拍到 AIGC”的理解很有帮助。工作流未必是先把传统技术全放下,再换成一种新工具。它更像是在一张不断变化的工作台上,按镜头需要挑选方法。屏幕录制可以提供现成结构,跟踪可以维持位置关系,生成可以补充难以直接获得的画面。不同方法解决的问题不一样,组合的理由应当由作品来决定。

如果只展示最终画面,很容易把创作理解成某个模型一次输出了完整答案。过程图让我们看见中间有大量不适合宣传短视频的工作:哪里需要固定,哪里需要遮罩,哪个动作要靠其他工具接住。这些工作也不浪漫,但它们让一个想法获得了可以交付的形式。

我想从这里提出一个衡量 AI 作品的习惯。与其追问“用了百分之多少 AI”,可以先追问一两个具体镜头:作者遇到了什么问题,为什么选择这个解法,有没有保住故事中需要的信息。百分比会把复杂协作压扁,而一个镜头的解决过程往往能显出作者的能力。

片子里的路牌必须真的在画面中产生后果,观众才会逐渐相信这套规则。只生成几张奇怪路牌,可以展示一个视觉点子;把符号、动作和后果连接起来,才能让点子不断往前发展。跟踪与合成在这里有叙事上的用途,它们要帮助观众看清变化如何发生。

09导演交出的控制,可能会在修改时重新找回来

生成视频带来的自由很明显:不必为每一次试验重新搭景,也不必先承担完整拍摄的成本。但这种自由包含一种交换。传统三维和合成软件中的许多操作有明确对象,移动灯光、调整骨骼、改变图层位置,都能较清楚地说明修改了什么。生成式修改有时会一次带动整个画面,局部要求和整体变化之间并不总能一一对应。

假设一条人物镜头已经通过初审,接下来只要把衣领上的字改清楚。如果改字同时改变了下巴、目光和背景的线条,创作者就必须重新检查整条素材。一次看似很小的反馈,可能使已经确认的内容重新进入不确定状态。这个成本不会完整体现在生成页面的单次价格里,却会真实地消耗项目时间。

所以我对模型进步的一项期待,是它越来越懂得保留已经确定的部分。创作并不总在追求更大的变化。做到后面,最珍贵的能力往往是精确地改一点点:手抬得稍早,衣服维持原样,停顿再留一会儿,其他内容保持一致。能否安全地接受修改,比第一次生成时有多惊艳,更接近专业流程的日常。

控制也有不同尺度。角色参考帮助回答“还是不是同一个人”;姿态和运动参考帮助回答“他如何行动”;镜头、空间或深度约束帮助回答“我们从哪里看”;时间轴和局部编辑则处理“事情在什么时候发生”。这些功能不该只作为按钮名出现在宣传图里,它们分别对应创作者需要保住的决定。

当然,完全可控也不必成为所有艺术创作的唯一理想。生成中的意外可能打开一个原本想不到的方向。问题在于,作者应该有机会决定什么时候欢迎意外,什么时候要求稳定。前期寻找视觉气质,可以让结果发散;进入角色定稿和镜头衔接以后,就需要减少无关变化。

这种工作方式要求创作者学会适时收拢。一直停在探索阶段,每个版本都可能更漂亮,却也可能让整部作品不断改口。完成一部片子,需要允许某些决定暂时成为事实。给模型更多自由与给作品保留连续性,两件事之间的分寸,应当由创作者掌握。

10演员的脸可以生成,表演的关系仍需要建立

讨论未来的演员,很容易直接跳到“真人会不会被替代”。我更愿意先拆开一次表演里发生的事情。一个人说出一句话,同时在看对手是否相信,判断是否继续解释,决定要不要把情绪露出来。脸上的变化与对方的反应、之前发生的事、此刻想达到的目的相互牵连。

如果只把表演理解为脸部表情,生成模型给出的结果可能已经相当吸引人。但一个人物为什么在这句话后面笑,为什么笑到一半停下,需要前后关系支持。相同的笑容,放在不同的镜头组合里,可以是羞怯、敷衍,也可以是威胁。角色的内在状态最终要通过整场戏被理解,不能由单帧表情独立保证。

这意味着,未来的表演制作可能有很多种分工。真人先提供动作和节奏,再转换外观;演员的声音保留,身体由动画或生成实现;完全虚构的角色通过分镜和剪辑逐步建立性格。方法可以变化,但当一个人的表演被用来指导另一个形象时,那份贡献仍应被看见,而不能因为脸已经换了就自动消失。

我尤其不希望技术把演员简化成可随时更换的面孔。演员也参与发现角色:他会提出一句台词说不出口的原因,会让一个预设动作显得勉强,也可能用一个很小的停顿推翻导演最初的理解。这种与另一个人的协商,有时比得到一张完全服从指令的脸更有价值。

同样不能因此否认生成角色可能产生的情感力量。我们会被动画人物打动,本来就说明情感不只依赖现实中的肉身。一个完全虚构的角色仍然可以有节奏、脆弱、习惯和令人牵挂的处境。这些细节需要在时间里积累,让观众有机会认识他;单个表情正确,还不足以完成这段关系。

我期待工具把表演的入口变宽,让没有条件组织完整剧组的人也能尝试人物戏。但我也希望创作者保留一种兴趣:愿意去听别人怎样说话,愿意看一个人在不自在时把手放在哪里。生成技术可以帮助实现这些观察,观察本身仍然要从人与人的接触中继续获得。

11旧手艺进入新工具,需要一个合适的入口

电影技术转变中,有一张很适合慢慢看的幕后照片:动画师站在装有传感装置的恐龙骨架旁边。这是《侏罗纪公园》制作中使用过的 Dinosaur Input Device,简称 D.I.D.。它尝试把对实体骨架的摆姿转换成数字数据,让传统动画经验能够进入新的计算机流程。ILM 的回顾也说明,它的效果并非总是理想,许多动画仍靠电脑关键帧完成。

Tom St. Amand(左)、Randy Dutra 与 D.I.D.。通过实体摆姿输入数字动画,是一次让旧经验进入新流程的尝试。ILM / Tippett Studio

我不想把这个装置写成一个所有人都顺利转型的童话。照片不能替我们回答当时每个人的工作处境。但它至少留下了一个可以继续思考的方向:技术更新时,工具可以主动寻找办法接住人的经验,而不只是要求人丢掉已经学会的东西。

今天也有类似的入口。Runway Act-Two把真人表演视频作为驱动素材,再与角色图像或视频结合。表演者的动作、表情与节奏,因此可以成为生成角色的依据。不同输入模式的控制范围并不相同,但这条路线已经清楚地表明,真人表演可以在最终影像没有出现真人面孔时继续发挥作用。

摄影师的经验也可以找到入口。一次现场拍到的逆光参考,一条明确机位高度和运动路径的预演,一组记录同一物体不同光照条件的照片,都可能帮助生成系统接近具体目标。美术设计不必因为模型能出图就只剩下挑选图片,它仍然可以先决定空间的用途、材料之间的关系和人物如何使用道具。

问题在于,这些工作能不能在项目安排中被承认。如果最后只按照谁点击生成、谁导出成片署名,前面提供表演、设计和参考的人就会被压到画面背后。新流程应该让责任更清楚:谁提出了空间方案,谁提供了动作,谁完成了合成,谁做了最终剪辑。工作不再出现在摄影机前,并不意味着工作没有发生。

我对职业转变的憧憬因此很具体。希望有经验的摄影师不用先把所有知识翻译成流行提示词,才能参与一个项目;希望演员的细腻表达能获得可用的控制接口;也希望年轻创作者有机会跟这些人合作,从真实反馈中知道一个镜头为什么成立。工具若能帮助不同经验继续相遇,它带来的自由会比“一个人包办所有岗位”丰富得多。

12模型正在进步,但各家走向作品的路并不相同

谈到具体模型,我想先把三个常混在一起的层次分开。模型负责某种生成或编辑能力,产品把能力组织成可以使用的界面,平台生态则决定素材、协作和交付怎样围绕它展开。相同模型经过不同产品包装,能用到的输入、修改选项和工作流程也可能不同。把一个应用的全部体验归结为模型分数,会漏掉很多实际差异。

以 Google 为例,Veo是一条视频生成模型线,Flow 是创作环境。2026 年 5 月的 Flow 更新又加入了 Gemini Omni Flash 与 Agent 等能力,围绕已有素材继续修改和组织工作。由此看,Google 正在把生成放进更长的创作过程。使用者应当分清自己调用了什么能力,不能把 Flow 看作 Veo 的另一种写法。

字节跳动在 2026 年 7 月发布 Seedance 2.5时,强调了最长三十秒的单次音视频生成、多模态参考与按时间段编辑,也展示了白模和绿幕相关控制。对制作而言,值得注意的是参考材料如何参与决定,而不只是时长增加了多少。一个粗糙的空间预演如果能更可靠地传达调度,前期设计就有了更直接的用途。官方同时承认复杂运动和多主体交互仍有改进空间,演示中的成功需要在自己的任务里重新验证。

可灵在 3.0 系列发布中把原生音频、多镜头和参考一致性放到了显眼的位置。这意味着产品开始接受更接近分镜表的输入,允许用户描述多个镜头如何展开。它可能减少一部分片段之间的接续劳动,也会带来一个新的判断:哪些剪切可以交给系统安排,哪些必须由创作者亲自决定。能接收分镜,不等于已经替作品理解了全部戏剧关系。

Runway 的路线可以从另一端观察。除了生成模型,其 Edit Studio围绕 Aleph 2.0 提供对已有视频的修改,先确认一帧的改变,再把修改延展到视频。这让实拍素材本身也成为生成式工作的起点。对于已经有拍摄能力的团队,能够在保留素材价值的前提下继续修改,可能比从空白开始制造一切更切身。

Adobe 的位置又有所不同。Firefly 的合作模型入口把多家能力放在同一个创作环境里。这里必须区分 Adobe 自有模型与合作模型,它们并不会因为出现在同一个界面就获得相同的训练来源与使用条款。对用户而言,统一入口可以减少操作切换,却也要求产品把差别说明白,而不能只把模型名称排成一列供人猜测。

统一入口还会改变创作者换工具的难易程度。人物资料、反馈与版本如果都留在一个平台,继续使用它会很方便,搬走则可能需要重新整理。平台有理由把服务做长,用户也有理由要求可导出的素材与清楚的版本记录。便利与迁移能力最好一起增长;否则某一天模型已经不适合项目,团队仍可能因为过去的积累而难以离开。

这些公开产品选择支持我的一个判断:竞争已经伸向“作品在什么地方被持续完成”。谁能理解参考素材,谁能接住修改,谁能让团队找到已经确认的版本,都会影响创作者是否愿意留下。漂亮样片仍然有用,但它只能回答第一次观看的问题。项目进入第三轮、第五轮修改以后,产品有没有耐心陪人把细节做完,会越来越重要。

这一节不是横评。我没有用同一组镜头实测这些系统,也不把厂商的演示当成命中率。把各家放在一起,是为了辨认它们给创作者提供了哪些不同的工作入口。这些入口最终有没有用,应当回到具体镜头的交付要求上检验。

看清模型之外的工作作品穿过的三个层次
  1. 01

    模型

    根据条件生成或编辑画面

    它能保留什么?
    它会改变什么?
  2. 02

    产品与工作流

    把参考、生成、修改和版本组织起来

    怎样继续修改?
    怎样交给下一位同事?
  3. 03

    生态

    连接计算、软件、授权、协作与发行

    谁承担维护?
    作品与素材能否带走?
贯穿三个层次创作者的观察、判断与责任

同一个模型可以出现在不同产品里;同一个产品也可以调用多家模型。

13比起一次生成多少钱,我更关心一条镜头怎样交出去

价格当然重要。尤其对个人创作者而言,每一次重复生成都会占用预算。但如果只比较平台上一条视频的标价,很容易把后续劳动遗漏掉。同样一段十秒钟的素材,有的可以直接进入剪辑,有的需要修脸、去除错误文字、补声音,最后还可能因为无法衔接而被放弃。

更接近制作实际的账本,应当把生成、筛选、修补、重做和交接放在一起。生成费用可以买到若干候选,创作者付出的时间才把候选变成可用镜头。把一次项目里真正花掉的时间记录下来,往往比引用一个与自己毫无关系的行业平均值更有帮助。

如果我要设计一轮小规模模型比较,会从作品中选出几类不同任务:有人物互动的镜头、需要连续空间的镜头、商品或文字必须准确的镜头,以及动作比较复杂的镜头。每类保留相同的目标和验收条件,再分别记录尝试次数、可用片段、明显错误与修补时间。模型支持的输入不同,应该在记录中说明,不能假装每家都接受完全相同的操作。

还需要区分两种实验。想比较“同一句话能得到什么”,就固定提示和基本条件;想比较“各自做到交付标准要花多少工作”,就允许发挥各家特色,但要把增加的参考制作、调参和后期时间计入。两个结果都可能有用,回答的问题却不相同。把它们混起来,常常会得到一个看似客观、实际偏向某种使用方式的排名。

评分也不宜只写“电影感八分”。可以先问角色身份是否保持、动作是否完成、接触关系是否合理、文字是否可读、声音是否对应。再看构图和节奏是否适合这部作品。前一部分比较容易达成团队共识,后一部分需要导演说明自己的意图。一个不符合本片气质的漂亮镜头,不会因为综合分高就自动变得合适。

这样的比较不一定需要很大的样本,但必须承认小样本的范围。十几个镜头只能帮助当前项目选择方法,不能轻易推导出某个模型永远胜过另一个模型。版本变了、输入变了、题材变了,结论都可能需要重新检查。对创作者而言,能清楚说明一次选择的理由,就已经比追着榜单更接近自己的工作。

最后还有一笔容易忽略的费用:无休止地继续试。生成越方便,越容易让人相信下一条一定更好。给一个镜头设定明确的停止条件,是对预算的保护,也是对注意力的保护。作品需要足够好的镜头继续往前走,不能每次都停在无限比较之中。

14平台会变化,作品得有自己的住处

一个真实的变化,让“长期依赖某个平台”这件事变得很具体。按 OpenAI 的官方停用说明,Sora 网页与 App 已于 2026 年 4 月 26 日停用,API 则计划在 9 月 24 日停用。产品退出不等于视频生成研究失去意义,却说明一个著名的名字也不能替作品保管未来。

创作者交给平台的,往往不只是一句提示词。人物参考、失败版本、修改理由、素材之间的关系,都可能在长期使用中积累在那里。如果最后只能下载一个成片文件,这些帮助重做和继续创作的过程信息就很难迁移。对于准备做续集、维护长期角色或反复修改商业项目的人而言,这是一项现实的制作问题。

所以我希望“能带走什么”成为选择工具时的常规问题。角色参考能不能完整导出,原始音频是否还在,镜头与版本是否对应,模型和参数有没有记录,时间轴能不能进入后续软件。不是所有项目都需要复杂管理,但重要素材至少应该有一份脱离某个网页仍然能理解的副本。

开放权重提供了另一种可能。Wan 2.2 的官方仓库同时提供代码与权重,并列出 ComfyUI、Diffusers 等接入方式。这里选择它,是因为这条开放工作链可以明确观察,并不是把它当作万相最新商业版本。有条件的团队可以保存模型、环境和流程,让已经建立的制作能力较少依赖某一个远端产品的持续运营。

不过,开放并不等于没有成本。计算设备、显存、依赖管理、版本兼容和故障排查都需要承担。模型权重公开,也不代表全部训练数据随之公开,更不代表任何电脑都能轻松运行。选择本地还是云端,应当把这些工作算进去。有人愿意付费换稳定服务,有人需要保留可修改的工具链,两种选择都可以合理。

我更愿意期待一种可以迁移的混合生态。模型厂商继续竞争能力,创作者能够带着自己的资产更换工具;软件愿意兼容常见格式,团队不必每换一家平台就重建全部角色与资料。这样,作品与作者之间的关系会比作品与订阅账号之间的关系更稳固。

这听起来像一个文件管理问题,却也关乎创作自由。一个人是否敢长期塑造某个角色,部分取决于他是否相信几年后还能找到材料、理解当时的决定,并继续修改。自由不只发生在第一次按下生成按钮的时候,也发生在很久以后重新打开作品的时候。

15生态里最容易被忽略的,是人的时间

生成模型的出现,把许多工序的成本重新分配了。有些劳动被缩短,有些被转交给其他人,也有些藏进了生成之前的数据与素材准备中。我们在界面里看到的几分钟等待,通常不是形成这项能力所需要的全部工作。训练数据的组织、工具的开发和维护、作品的检查,都在更长的链条里。

这也是为什么我不满足于“技术让每个人都成为导演”这句话。每个人都能更容易尝试导演工作,值得欢迎;每个人都要独自承担编剧、摄影、美术、声音、后期、项目管理和客户沟通,却可能成为另一种过重的要求。工具省下的时间,如果全部被用来增加交付数量,创作者未必因此获得了更宽裕的创作空间。

同样,团队规模缩小不必然等于协作变差。一个小团队可以有明确分工,也可以形成很好的默契。值得警惕的是贡献逐渐变得难以辨认:有人准备了一整套角色设定,有人反复录了动作参考,有人修好了最难的一镜,最后却只留下“AI 一键完成”的叙述。省略劳动会制造不切实际的价格预期,也会让后来者误判学习所需的投入。

行业已经在尝试为这些新关系订规则。SAG-AFTRA 的 2026 年协议说明分别讨论数字复制与合成人物,设置相应的通知、同意或协商安排;WGA 的 2026 年说明也继续处理 AI 与编剧作品训练授权的关系。这些是特定集体协议中的安排,不能当作全球统一规定,但它们说明一个方向:谁的能力参与了生成,正在成为需要明确讨论的工作条件。

我希望小型 AIGC 团队也逐渐形成自己的清楚习惯。使用谁的声音,角色参考来自哪里,允许使用到什么范围,后续修改由谁负责,尽早说清楚。它不必一开始就是厚厚的合同语言,却应该让参与者知道自己答应了什么。让合作变得可理解,比在项目结束以后争论谁才算作者更实际。

还有资源的使用。云端计算不会因为用户桌上没有大机器就变成没有物质成本的魔法。对个体项目而言,可以先减少明显无效的工作:先用低成本预演确定镜头目的,再提高规格;确认角色以后再并行扩展;避免为了追逐一个没有验收标准的“更好”反复生成。节制可以来自制作上的清楚,而不只是道德上的自责。

一个健康的生态,应当允许工具公司获得持续改进的收入,也允许创作者保留完成作品所需要的时间。两者之间需要不断谈判。技术进步可以提供条件,不能自动决定这些条件最终会被怎样分配。

16当漂亮画面不再稀缺,观看会变得更挑剔吗

我能想象一种并不遥远的日常:打开创作软件,任何风格都能迅速得到几个足以展示的版本。雨夜的霓虹、荒原上的列车、黄昏里巨大的废墟,都不再需要很长时间准备。对做片的人,这是令人高兴的便利;对准备观看的人,片段的数量却可能增长得比可支配的时间更快。

观众不会因为世界多了十倍视频,就每天多出十倍时间。于是创作的困难会从“能否做出画面”继续延伸到“为什么值得被看完”。一个开头可以靠奇观吸引目光,后面的镜头仍要逐步兑现它提出的期待。如果每一次转场都只是在证明还能变成另一种景观,观众迟早会知道自己无需等到结尾。

我担心一种越来越顺滑的审美:每个画面都自动拥有适中的景深、漂亮的光线、可识别的情绪,彼此却没有太多非如此不可的理由。人物悲伤,于是下雨;故事孤独,于是站在空旷城市;未来出现,于是遍地蓝色光带。它们并非不能使用,只是使用得太容易以后,创作者需要重新检查自己有没有在借熟悉的符号省略观察。

这件事也不能全怪模型。人类创作早就会使用套式,商业制作也一直受模板和市场偏好影响。生成工具让某些熟悉组合更容易被调用,也让人更快看见自己的惯性。连续十个版本都只有相同的空旷和落日,有时可以成为一个提醒:也许该换的不是形容词,而是自己对这场戏的想法。

一个有生活细节的空间,未必比一个宏大空间昂贵。想想两个人合住的房间,一边窗帘拉得很整齐,另一边桌面还堆着没拆完的快递;同一盏灯对一个人是工作照明,对另一个人是睡不着的原因。空间一旦被人物不同的需要占据,就有了关系。模型能帮助做出这个房间,创作者要先看见这些需要。

未来观众会不会更挑剔,我不敢下结论。有些内容消费追求短暂刺激,有些观看仍愿意把时间交给缓慢展开的故事,两者可能长期并存。我更希望创作者不要过早替观众断定他们只剩几秒耐心。如果所有作品都预先放弃等待、沉默和含混,那些观看能力就更难得到练习。

算法推荐与个人创作之间,也需要留下一点距离。平台可以告诉我们哪里容易被划走,却未必知道某个停顿为什么必须存在。创作者当然可以理解数据,但不必把每一个留存曲线上的下落都当成艺术上的错误。一次有意识的冒险,应该允许在看过结果之后继续讨论,而不是被一种指标自动取消。

17生成的梦,仍然要有自己的秩序

我们也不必要求所有 AIGC 作品都把生成痕迹藏好。有些题材可以主动使用它在空间变换、材质流动和形象转化上的特点。梦、回忆、寓言和意识中的联想,本来就不总按日常物理空间展开。适合它们的形式,可能和一场需要严格对位的写实对话不同。

Paul Trillo 为 Washed Out 制作《The Hardest Part》时,就在唱片公司刊载的创作陈述中谈到了穿过一对情侣多年生活的视觉旅程,以及场景融合与记忆感的关系。这提供了一个有用的制作思路:某项技术容易产生的变化,可以被放到适合这种变化的叙事中。这种选择是否适合另一部作品,要看它如何处理自己的时间与情绪。

早期 Sora 作品《Air Head》也能提供另一面。shy kids 的制作访谈谈到气球头人物的构想,以及生成后继续进行的剪辑、声音和调色。气球头是一个明显不可能的形象,但作品要围绕它组织情绪和处境,仍然需要具体制作。另一篇主创采访还记录了后期清理与裁切。这些经历记录的是 2024 年的早期测试版本。

《Air Head》(2024)的后期过程。生成素材进入剪辑、合成与调色,才逐渐组成一部作品。shy kids / No Film School

我从这些案例里得到的启发,是可以把注意力从“如何完全像实拍”移向“这种表达为什么适合被生成”。一个空间在人物想起往事时慢慢融成另一个空间,可能帮助我们感受记忆的连接;同样的变化如果出现在一场需要清楚交代逃生路线的戏里,就可能妨碍理解。效果本身没有替作者决定使用场合。

梦也不能成为所有不连贯的借口。观众即使接受世界会变化,也需要逐渐认识变化的方式。某种颜色是否总与同一个人出现,声音是否先于记忆到来,一个反复出现的物件有没有发生新的意义,这些都能给漂移的画面建立关系。作品可以放松物理规则,但仍然需要安排注意力和情绪的方向。

这让我对未来的影像语言感到好奇。我们也许会见到更难归类的作品,介于摄影、动画、散文、游戏与梦境之间。它们不必先证明自己能复制某一种既有电影,再获得被认真讨论的资格。只要形式选择能够支撑具体感受,新的方法就有机会形成自己的表达传统。

同时,我不愿把每一次变形都叫作创新。有些效果只是在第一次看见时新鲜,重复以后就失去了理由。变化需要与这部作品的处境发生关系。一个人记不清故乡的门牌,街道才逐渐变得不稳定;一个角色无法面对某张脸,脸的缺失才进入观看。观众可以不知道工具名称,仍然感觉到这些选择来自同一个想法。

18我们需要更容易知道,一幅画面经历过什么

当生成影像越来越接近摄影,我们面对的困难不会只停留在辨认真假。即使某次检测正确,也未必能解释画面哪些地方来自现场、哪些经过修补、哪些是完整重建。未来很可能有大量混合素材,简单贴上“AI”或“非 AI”两个标签,仍不足以告诉观众它如何到来。

一个故事片可以直接说明某些角色或环境使用了生成,观众通常仍然能够按虚构作品的方式观看。纪录片、新闻、历史重建则需要更具体的说明:是否让生成内容承担了证据的角色,是否重建了没有记录的事件,人物说的话有没有真实出处。越是接近事实陈述的用途,越不能用画面的逼真替代可核查的来历。

C2PA 的来源记录说明提供了一种技术方向:记录内容的来源与修改过程。它本身并不判断画面所描述的事件是否真实,也不能让没有凭证的内容自动变成伪造。对普通观众而言,这类机制的价值可能是多一个可以追问的入口,而不是得到一个包办判断的真假按钮。

训练与素材的来历也会影响创作者愿意选择什么工具。Adobe 在其生成式 AI 原则说明中强调自有模型的许可内容与公共领域内容训练路线。这是厂商提供的一种承诺,应当按具体范围理解;不能把它扩大为同一产品中所有第三方模型的统一保证。清楚的说明能帮助使用者做决定,含混的“放心用”则把问题重新推给了创作者。

我希望未来这些说明可以做得简洁一些。观众不必先读一份技术报告,才能观看一个短片;想了解的人又可以找到角色、声音和重要素材的贡献记录。创作者也不应为了正常标注制作过程,就被迫公开所有私人资料或完整工程。透明和隐私需要同时考虑,不能以一种极端替代另一种。

把来历说清楚,并不会减少虚构的魅力。知道恐龙来自机械装置和计算机,并不妨碍我们在电影里害怕它。知道一个角色由演员驱动、经过生成转换,也不必妨碍我们被他打动。说明来历减少的是不必要的误解,作品仍然可以在承认制作方法以后继续成立。

这里有一个我愿意坚持的区分:艺术可以制造一个没有发生过的世界,同时诚实地告诉观众自己正在虚构。我们没有必要以含混的方式偷取现实的信用,才能让想象获得力量。

19我期待的未来,是一张怎样的工作桌

如果要描述我期待的制作环境,我不想从一条越来越夸张的宣传片开始。我更愿意想象一张普通的工作桌:几个人正在做一部短片,桌上有实拍照片、手绘分镜、录下来的环境声,也有生成的场景与角色版本。工具并不要求他们先选边站,决定整部片子只能实拍或只能生成。

人物最重要的一场对话,他们请演员认真排练,保留对手之间真实发生的反应。背景需要出现一座不存在的城市,就用可控的生成与合成去扩展。一个动作太危险,先做预演,再判断是否需要替身、三维或生成处理。声音里保留真实地点的特点,必要时补充设计,而不是所有空间都被相同的音乐铺满。

这个环境应当允许人用自己擅长的方法表达要求。摄影师可以给机位和光线参考,美术可以给平面图和材质样本,演员可以给一段动作,导演可以直接在时间轴上指出停顿的位置。自然语言当然方便,但它不必垄断所有控制。很多专业知识用画、用做、用演,比用一大段形容词更准确。

我也希望模型能够记住团队已经确认的事情。角色衣服上的纽扣不会每次重新决定,房间里的门不会为了反打任意挪动,一个动作改变后,相关镜头能提示哪里需要复查。这是一种对协作有用的稳定性。至于它由持久场景表示、检索、约束生成还是其他技术实现,可以留给不同系统探索。

在这样的工作桌上,生成不应该永远要求人守着屏幕抽取下一条结果。Agent 可以帮助整理素材、对齐版本、发现明显的不一致,也可以协助执行已经决定的批量操作。但“这段停顿要不要留下”“角色是否应该在这里道歉”之类决定,应该仍然可以由创作者清楚地接管。自动化越深入,退出自动安排、恢复自己的选择就越需要方便。

这张工作桌还应该可以搬家。团队能导出素材,能知道角色来自哪些参考,能把工程交给另一位剪辑师,能在更换模型以后继续工作。有人暂时离开项目,新加入的人不必从零猜测所有决定。过去做过的工作能够继续生效,未来才不只是一次次重新开始。

我愿意相信,这种环境会让更多原本没有拍片机会的人拥有第一次完整尝试。县城里熟悉某种生活的人,可以先讲自己的街道;有身体障碍、难以长时间进入片场的人,可以参与不同阶段的创作;擅长写作却缺少制作预算的人,可以用短片检验一个想法。这些可能性不会自动兑现,工具的价格、无障碍设计、语言支持和学习资源都会影响谁能进入。

而学习资源也可以换一种组织方式。少一些把最新按钮当作全部知识的教程,多一些解释选择的案例:为什么这里保留演员表演,那里使用生成;一个镜头试了几种办法,失败在哪里;最后删掉了哪条最好看的素材。这样的知识更容易跨过产品更新,也能让新手逐渐形成自己的判断。

要接近这样的制作环境,还有许多条件需要争取。平台可能越来越封闭,修改可能仍然昂贵,创作者也可能被要求用更短时间交更多内容。憧憬需要有具体方向。我们希望工具增加哪些选择,希望合作怎样发生,希望省下的时间有一部分真的回到观察、排练和思考中。把这些愿望说清楚,才知道哪些变化值得支持。

把当下与愿望分开我期待的下一张工作桌
当下用参考约束一个镜头

对具体结果逐一检查,修正不连续之处。

愿望在同一个世界里持续调度

物体、空间与动作状态能够长期保留。

当下在多种工具之间接力

保存素材、参数和版本,主动整理交接。

愿望带着自己的作品自由迁移

换一个模型或平台,不必从头建设全部资产。

当下减少某些画面制作的阻力

让小团队有机会试着完成更复杂的表达。

愿望把多出来的时间交还给人

有余力观察、排练、倾听,并认真完成一部作品。

右侧是作者期待的方向,不是已经实现的产品能力,也不表示确定的到来时间。

20最后,还是回到那扇窗

写到这里,我想回到开头的镜头。一个人站在窗边,听见楼下有人叫他,手已经抬起,却没有推开窗。我们现在有了更多实现它的方法:真的找一间房,搭一个布景,录一段动作参考,生成窗外的街道,或者把这些方法组合起来。

技术进步会继续改变它的制作成本,也可能把过去很难控制的细节交到我们手里。我愿意为这种进步感到高兴。很多念头本来没有机会变成作品,只因为它们所需要的场地、人员与时间超过了创作者能够承担的范围。这些念头现在能够先做成一小段,让作者和观众看一看它是否值得继续。

但我想保留的,还有窗外那些没有被预先写好的声音。一个人站在那里时,也许会听见楼下有人叫错了名字,会发现自己对角色的理解太简单,会在另一个人的表演里看到新的理由。世界并不总按照创作者的计划配合,和它相处的过程,也会让创作者改变。

因此,即使有一天我们能在室内完成绝大多数画面,我仍然希望自己愿意离开工作桌,看看真实的街道,听一段没有被整理好的谈话,注意一个人为什么忽然不再接话。回来以后,模型可以帮助把这些观察变成原本做不到的影像。观察不必因为实现变容易而变得草率。

从实拍到 AIGC,至少在我期待的方向里,创作者能够调动的材料会更多,进入创作的机会会更广,修正一个想法的代价会更低。与这些便利一起保留下来的,应该是对人的兴趣、对具体事物的耐心,以及为作品中的选择负责的习惯。

未来那扇窗可以由很多种方法做出来。等到窗、光线、街道和人物都已经准备好,我仍然愿意花时间想清楚,他为什么没有把窗推开。这是我想继续做的创作。