玩 AI 视频有一段时间了,经验说不上多,但有一件事我算是想明白了:提示词这条路,走到头也就那样。
不管你把镜头描述得多细,缓缓推进、镜头从左向右摇、人物沿弧线走向画面深处,模型收到的永远是一段文字。
文字这个东西,天生就描述不了精确空间。你脑子里那个镜头是具体的、立体的,但要交到模型手上,得先由你翻译成文字,再由 AI 把提示词润色一遍。
每过一道手,都在丢信息,第二道你还插不上手。按下生成键之前,没人知道模型最后读到的是什么,对于专业创作者来言,整个过程是个黑箱。
剩下的办法只有一条,抽卡。一条一条试,一条一条调。Seedance 2.5 生成一条 30 秒的视频大概要 70 块钱左右,一颗复杂点的镜头平均要抽两三次才能勉强能用。对个人创作者来说,这个成本说实话有点顶不住。
到最后,几乎每个创作者都会在想,如果能在视频生成之前就知道它的大概效果就好了,让微调发生在生成最终视频之前。
这个看似异想天开的需求,其实是有可行的解决方案的,因为很多时候生成视频有问题大部分都是运镜、人物动作、空间位置关系,这些和自己预想的走差太多。
粗略地打一个比方,这个视频的大体框架需要提前设定好,然后按照这个框架再去生成视频,就会极大提高成功率。
再用一个直观的比喻来说,就像是 Stable Diffusion 时代的 ControlNet,视频生成同样需要属于它的 ControlNet。
对了,它其实是有自己的名字的,就是白模参考,而这,才是最有效的空间控制方式。
其实,ControlNet 那篇论文里就说得很明白,纯文本提示词很难精确表达画面的空间布局、人物姿态和构图,因为文生视频系统本来就缺乏空间锚定,物体位置、机位、走位调度都难靠文字管住。

而一个粗糙的 3D 场景,反而能当视频生成的空间锚点。Seedance 2.5 官方也专门强化了白模参考能力,还出了一份提示词规范,把白模分成粗粒度(管动作、动线、运镜)和细粒度(管结构、材质、重渲染)两种。


道理都对,问题是学建模这事儿,门槛太高了。
目前我知道的做白模参考的路子大概两条:一条是学 Blender 建模,自己搭场景、录摄像机运动,导出视频当参考,效果确实好,但学一套 3D 建模软件,几个月起步。
另外一条是 ComfyUI 搭 ControlNet 节点工作流,用深度图和白模做空间控制条件,AI 视频圈里已经有人这么干了,路子验证过是有效的,但你得懂节点编程思维、会调参数,上手门槛同样不低.
两条路要么学习成本高,要么控制精度差,普通个人创作者卡在中间,两头都够不着。
周末这两天我发现 B 站的视频创作平台 updream 上有一个叫预演台的功能。说白了就是能省掉建模这一步,直接生成白模参考视频,再拿这个白模去生成精准的成片。

看了他们的宣传片,觉得效果还真不错。

于是抱着试试看的心态捣鼓了两天,先来看看这个对比视频,一个白模视频和参考白模视频最终生成的结果,

可以说,镜头运镜和人物姿势以及场景基本能做到跟白模参考完全一致,看来 Seedance 2.5 对白模视频的还原效果非常棒,说是像素级复刻也不夸张。
当 AI 视频中的角色可以完全按照你的想法去执行运镜、走位、动作等等,而不是一个粗略模糊的效果,你的 AI 演员完全会听你这个导演的安排,那就等于具备了工业级影视生产的能力。
接下来把我把这个多镜头切镜的视频为例,把操作过程一步一步讲清楚。
第一步,建场景。
先在 updream 里新建了个项目,在项目里右键新建预演台。

点开之后是空的,什么都没有,场景、人物、机位都得自己搭。

我上传了一张场景参考图:

预演台就自动解析空间结构,生成一个带深度信息的 3D 白模场景,全程没打开过任何 3D 软件。

这个是 updream 预演台的独家功能,一张图搭出一整个 3D 场景,不用学建模,几分钟就干完了建模师一天的活。空间层次、物体比例、遮挡关系都还原得挺到位,这个精细化程度在现在的 AI 视频工具里应该一数二的了。
第二步,建人物和机位。
场景有了,就该新建人物了,在左侧选择新建人物。

人物的名称、颜色、体型身高、姿势都能自己设置,我这次需要人物走起来,所以先选了个行走姿势。

左侧工具栏里选第三个移动按钮,选中人物就能拖着挪位置,上下左右不同方向的坐标轴颜色不一样。
选中哪个坐标轴,它就会变黄,拖动箭头就会按这个坐标轴进行移动。

下面一个按钮是旋转,同理,坐标轴变黄的方向就是可以转动的方向,可以调整人物的朝向。

想让人物有一条明确的行走路线,就得在下方给它加一条轨道,

加完之后可以直接绘制或标记人物的运动轨迹。

我画了一条直线,让人物走向前面的建筑,点最左边的播放按钮能看到整条轨迹跑一遍。

想让人走慢点,就把下面对应的片段拉长。

接下来是新增机位,机位的调法和人物完全一样,也是靠左侧的移动、旋转按钮。
唯一不同的是,右上角有个监视器窗口,实时显示这个机位拍到的画面,你可以照着这个窗口来微调机位角度。

因为这次机位要跟着人物一起移动,我也给机位加了一条轨道。

机位这边除了能自己画轨迹,还能直接选跟踪人物,等于新建一个特写跟踪,人物多了还能挑指定跟哪一个。

右侧选项栏里可以选机位的朝向和跟踪锚点,设置好之后摄像机就会一直跟着人走。多机位的话,按同样方法一个个建好,再调各自的持续时间。

根据同样的方法,设置不同的机位,然后调整各个机位的持续时间。

都弄完点右上角录制,我一般用的是全局录制。

录完的白模视频会直接导出到工作台。

配上一张人物参考图,再补一段不长的提示词,就生成出了前面那条皇帝走向宫殿的视频。

基本的操作方法就是这样,大家感兴趣的话,可以自己动手试一试,看着那些角色完全按照你的设想去演戏,还是非常有成就感的。
有了这套流程,我又做了几条不同类型的案例,一步一步加难度。
先做个一镜到底的视频。
最近《牛来》这部电影挺火的,我就凑热闹整个活儿,做了一个牛来一家对话的视频。
三人对立关系,这次人物基本没动,全靠机位一直变化。我给机位画了一条运动轨迹,幅度不算大,画面上能看到那条蓝色的线在慢慢移动。

设计好牛来一家的角色参考图,你还别说,设计图的过程要想做出牛来的那个粗糙感,费了我好几次抽卡,AI 也学不会如此简陋的贴图材质吧,不由自主的就美化了生成效果。。。
还好到最后抽到了比较贴近原材质的角色效果图。

然后同样参考这个效果,做了牛来一家的角色图以及场景图,导入到无线画布中。

给这个小视频设计了几句台词和脚本。
给大家看看最后的效果。

机位的移动完全和白模参考视频一模一样, 为了保持原片的粗糙感,特意设计了运镜的卡顿,自然,生成的视频也完全保持了原汁原味的节奏。
果然是有了预演台这个功能,生成的视频都能所想即所得。
但是对比下没有使用白模参考视频生成的视频后,就知道区别在哪里了:

三个人物的位置差点就站成了一排,不过这糟糕的结果直接神似原片。
最后我又上了点难度,本来是草原上男生跑向女生的运动镜头。
对了,如果没有场景图那不上传也可以给它发挥。

我在最后又加了个环绕镜头,两人对视后拥吻,接着镜头绕着他俩转一圈。
这个操作也不复杂,就是给机位单独画一条环绕轨迹,其余步骤和前面一样。

再在右上面的监视器里看看环绕镜头的效果怎么样?

当然我知道大家肯定更期待最终生成的视频,一起来看一下:

顺带说一句,预演台生成的这种白模都属于粗粒度白模,简单几何体,负责的是动作、动线、站位、运镜、切镜这些时序信息。
如果你手上已经有现成的细粒度白模,比如结构完整的 3D 模型,也可以直接导入,用来重渲染材质、色彩和整体视觉风格,两种精细度对应的用途不太一样,看具体需求选。
这几条视频做下来,我最直接的感受是:脑子里的镜头终于不用再翻译成文字了,直接在白模场景里像导演一样把机位和走位摆出来,模型照着白模拍,运镜精度肉眼可见地稳。
之前靠纯提示词,一个复杂镜头要抽两三次才能凑合用,现在有了白模参考,基本一次就能拿到想要的运镜和站位,后面只需要在渲染质感上再调整,抽卡次数确实降下来了不少。
但也得说句实在话,这东西不是一键出片,也没法彻底消灭抽卡,它解决的是可控性问题,不是运气问题。
预演台本身有一定上手门槛,第一次进去面对空场景、空人物、空机位,得自己一步步搭起来。
建议先看一遍教学文档,熟悉一下移动、旋转、轨道这几个基础操作再动手,不然容易在坐标轴颜色和轨道逻辑上绕晕。另外白模只负责动作、站位、运镜这些时序信息,人物长相、服装材质还是得靠参考图和提示词单独定义,这部分的对应关系要写清楚,不然容易出现主体错位。
好了,感兴趣的小伙伴赶紧去体验吧~
另外插一句,updream 千万积分挑战赛正在征稿,分预演成章和导演手册两个赛道,一个拼作品创意,一个拼教程干货。
感兴趣的可以顺手报个名,拿真实案例练练手,比自己瞎摸索省不少时间,而且单条优秀作品最高可获得 100 万积分奖励,价值 1 万元呢。
文章来自于"网罗灯下黑",作者 "网黑哥"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0