价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片
AI资讯 2026-08-08 17:24
+8912 阅读

电影发明以后,人类的生命,比以前至少延长了三倍。


AI 电影发明以后,人类的生命又能延长多少倍。


350 万元,115451 个资产文件,95 分钟,15 人团队,14 天的 AI 生成周期,一部完全由 AI 生成的电影来了。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


没有摄影机,没有演员,也没有实体场景,电影中的每一帧都是由 AI 生成。视频和对白主要由 Seedance 2.0 生成,角色与场景使用 Soul Cinema,图像修改则调用 Nano Banana Pro、Seedream 4.5 和 GPT Image 2。


今年五月,这部 AI 电影在戛纳电影节同期的第三方行业活动中放映,是一部包含博物馆盗窃、恶魔、地狱和超能力的动作奇幻片。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


完整电影视频来源:X@higgsfield


ROKO、JAXX、LULU 和 REIN——四个一无所有、无所畏惧的街头孩子。某一天,一座博物馆,一个计划——直到一切在他们于展厅中发现一件没有名字、没有历史的文物时彻底崩塌。


一次触碰——他们每个人都获得了一种从未请求过的力量,唤醒了某种本不该被唤醒的存在。现在,他们必须正面迎战远古邪恶——即使这条路将他们直通地狱。


四个从出生起就被世界抛弃的孩子,如今却成为了世界最后一道防线。


最近,电影的制作团队 Higgsfield 公开了这部名为《Hell Grind》地狱磨砺的完整制作资料。每一幕每一场,累积十万多个资产,生成的视频不计其数,我们都能在 Higgfield 公开的项目地址查看。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


https://higgsfield.ai/@higgsfield.studio/projects/hell-grind


每一个资产里面,都有完整的提示词和使用的参考图片,如果你有足够的 Seedance 积分,甚至可以 1:1 复刻一个同款电影。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


里面还有不少中文提示词


官方透露,团队在完成前期资产后,用 14 天生成了整部电影需要的素材,随后再进入剪辑、修复、调色和声音制作。项目预算虽然「高达」50 万美元,但其中大部分都是花在了视频生成消耗的算力上。


我们花了一个半小时看完了这部 AI 电影,说实话,一部电影该有的元素它全部都有,跌宕起伏的故事与主题、鲜明的人物形象、区别于普通视频的视听语言、以及表演和导演。


在某一瞬间,甚至让我想到了小时候看的「铠甲勇士」。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


故事情节就不如范大娘的「混世人魔」有趣了


但社交媒体上还是不少网友表示,如果以后的电影都是这样的话,那电影可以宣告死亡了。


毕竟一旦提到是 AI 生成的内容,无论文字还是视频,就自动贴上「廉价」、「毫不费力」、「敷衍了事」,甚至是「垃圾」等标签。


Higgsfield 这次公开的电影制作流程,似乎和「简单」二字完全没有关系,50 万美元的成本也并不廉价,在这份内部手册记录的内容里,更是只让人看到了永无止境的尝试和成篇大段的复杂提示词。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


例如一个最简单的问题,如何要让一个没有记忆的模型,连续 95 分钟记住同一张脸、同一个房间和同一种表演?


答案可能会有一些反常识,为了让角色在不同镜头中保持一致,团队会故意砍掉角色设定图里的脑袋;为了避免人物换位,每个场景开头都要浪费一秒钟,让 AI 重新认识房间;为了生成一段十几秒的镜头,一份提示词甚至能写到三四千字。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


这份指南像一把手术刀,把如何用 AI 制作一部电影的具体方法、可能踩到的坑,以及各种干货资讯全部公开出来。它让我们看到一个普通观众几秒钟看完的镜头,到了 AI 面前究竟要被拆成多少部分?等于多少个提示词?


我们也把这套复杂流程拆成五个普通创作者也能复用的方法:先做资产、给空间画地图、把情绪写成动作、用提示词充当场记、在十几次失败后主动简化镜头。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


Higgsfiled 也有提供 AI 电影学院课程,以及此次 AI 电影的三份 Skill


https://higgsfield.ai/@higgsfield.studio/projects/hell-grind


用提示词解构电影


解构一部电影,首先要区分两类信息;一类会随着剧情变化:角色走进房间、拿起武器、说出一句话。另一类需要在整部电影里保持稳定:角色长什么样、怎样走路、使用哪种口音、紧张时会做什么。


《Hell Grind》把后一类信息做成了角色资产。每名主要角色都有一段固定的外貌描述,以及三张参考图:面部特写、正面全身和背面全身。正面全身图甚至会被故意去掉头部,避免模型在生成远景时读取那张过小、模糊的脸。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


这些参考图也被刻意做得很朴素:灰色背景、平光、清晰毛孔,没有胶片颗粒和戏剧化灯光。角色图的存在,只负责回答一个问题:这个人究竟是谁;而后续的电影感应该留给具体的场景再做决定。


外貌之外,声音和行为也要被固定。比如,一个角色的声音可以被写成:低沉、沙哑的男中低音;语速缓慢,带伦敦街头口音;始终保持具有威胁感的平静,从不提高音量。


他的行为则会被总结成另一段文字:走路的节奏、手部习惯、眼神如何移动、受到压力时怎样掩饰、情绪崩溃前会出现什么动作。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


角色坐下后,原本来回踱步的焦虑也不会消失,而会转移到摇晃身体、敲击手指和突然加快的手势上。


一部电影中的「角色」,由此被拆成了四组可以反复调用的数据:一张脸、一套身体和服装、一种不会漂移的声音,以及一组贯穿全片的行为习惯。


电影中的人物还会受伤、淋雨、换衣服。传统拍摄可以让演员换一套服装继续表演,AI 模型却容易把角色的多个状态混在一起。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


电影中的男主角获得超能力后会变身,变身的每一种状态都需要一个资产文件


因此,《Hell Grind》里的每种状态都被拆成独立资产:@roco 是普通状态,@roco_wet 是淋雨后的状态,@roco_blood 是受伤后的状态。


白天、夜晚和雨天的同一个地点,也会被当作三个不同场景管理。


一件关键道具甚至有三个版本:


正常展示的完整版本、放在手掌里的染血版本,以及藏在拳头里的隐藏版本。


这套方法背后的逻辑就是:与其期待模型理解一个资产的所有变化,不如把每种变化都变成确定答案。


把电影场景写成一张平面图


角色之外,AI 电影最容易崩坏的是空间。


人类看到一个房间的正面,通常可以推测房间背后和侧面有什么。


但视频模型换一个机位,门窗、家具和灯光都有可能重新排列。上一镜头中,角色站在桌子左边。切到近景后,他可能瞬间出现在另一侧;两个人的站位也可能互换,摄影机甚至会突然越过轴线。


《Hell Grind》的解决方法,是给每场戏编写一份固定的空间地图,例如


圆形训练垫位于房间中央;


房门在画面左侧的远墙上,距离训练垫八米;


五个损坏的人偶散落在画面右侧;


长椅距离训练垫两米;


摄影机始终停留在房门一侧,不越过这条轴线。


这段地图里不存在人物和剧情,只记录空间里永远不变的东西。同一场戏的每个镜头,都要逐字复制这份地图。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


团队还会在场景里寻找一个视觉锚点,像是如果用「角色站在房间里」给了模型太多选择,但「角色站在灯旁,面向房门」则把人物、空间和视线固定在了一起。


人物位置也统一使用「画面左侧」「画面右侧」和具体距离。因为「站在角色左边」会随着人物转身改变,「画面左侧」却始终只有一个答案。


传统片场里,这些信息存在于布景、地面标记、演员走位和场记照片中。到了 AI 电影里,物理空间消失了,整个片场又被人用文字重新搭了一遍。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


还有一个小建议是场景参考图则尽量选择 3/4 视角。正面构图看起来像一张漂亮壁纸,提供的空间信息却很少。3/4 视角能让模型读到墙面、纵深和转角,换机位时更容易推测房间的其他方向。


把十二秒切成可以执行的动作


接下来,镜头需要被拆成时间。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


以一场训练室的戏为例,12 秒的动作大致会被写成:


0—1 秒:整个房间保持当前状态,一个损坏的人偶仍在摇晃。


1—4 秒:房门打开,两个人走进训练室,在训练垫边缘停下。


4—8 秒:主角先用眼睛发现他们,随后转头;胸口急促起伏,下巴绷紧一次。


8—12 秒:主角说出台词,三个人脸上的笑容同时出现裂痕,没有人继续向前。


每场戏的开头,一定是先花一秒让 AI 认路。通过在每场戏开头安排一个约一秒钟的全景镜头,人物不说重要台词,也不执行复杂动作,只负责站在正确的位置上;让模型确认现场的情况。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


完成这次确认后,后面的动作和对白才正式开始。


为了让不同生成片段衔接得更自然,团队还会把上一段对白的结尾放进新镜头的第一秒


。演员先接住上一句话的尾音,再说自己的台词,嘴型、语气和反应就更容易连在一起。


《Hell Grind》的一条视频提示词可以达到三四千字。长度来源于一套固定结构:


场景里有几个人,禁止复制;


每个角色和场景分别参考哪项资产;


房间的固定空间地图;


第一帧里每个人站在哪里;


镜头时长、焦段和摄影机运动;


每几秒发生一个动作;


道具的重量、接触和惯性;


唯一的光源与阴影方向;


对白、声音和环境音;


每个角色的行为状态;


画面中必须成立的数量与关系。


虽然提示词很长,单个动作段落却要尽量短。


团队发现,一个时间节点最好只容纳两三句话。模型可以阅读三千字的整体规则,却很难在同一秒完成开门、转身、说话、挥拳和改变表情。动作塞得越多,人物越容易在画面里犹豫、瞬移或者直接停住。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


复杂动作还要从生成的第一帧直接开始。


如果角色需要撞破一扇门,提示词会写成「他已经处于挥拳中段,门板已经开始裂开」。如果用「走到门前、抬起手臂等准备动作」会被拆成另一个镜头。


AI 视频的镜头设计因此也越来越接近漫画分镜:每一格只解决一个最重要的动作。谁又说这不算是另一种「古法」呢?


删掉「愤怒」,写下他的下巴


角色表演是整套流程里最反直觉的部分。直接告诉模型「他很悲伤」「他非常愤怒」,通常只能得到夸张、浅层的表情。团队更愿意描述身体正在发生什么:


他的下巴绷紧后松开两次;


鼻血流到嘴唇,但没有抬手擦掉;


一次缓慢眨眼,紧接两次快速眨眼,再用力闭眼;


目光先落在地上的碎片上,随后才转向门口。


角色的内心 OS 也会写进提示词:他想在别人进门前再完成一次攻击;他想隐藏手臂正在失控;门被推开的瞬间,他重新挂上一点勉强的笑。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


这些内容不会直接出现在台词里,却会改变角色的呼吸、眼神和动作节奏。


指南里还提到静态镜头最好每一两秒出现一个微小事件:胸口随着呼吸起伏,鼻翼轻轻移动,手指敲击桌面,眉毛收紧后放松。


而「所有人保持不动」之类的提示词,很容易让模型真的冻结画面。更有效的表达是「人物用力维持静止,呼吸仍然没有恢复」。


对白也被严格限制在声音模块中。每个角色只能说引号里的句子,没有台词的人必须保持安静。声音描述、口音、语速和说话习惯会像角色外貌一样,逐字复制到每一个镜头。


在这套系统里,表演变成一连串可以被摄像机看见的生理变化。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


《Hell Grind》采用逐场景生成的方式。每一次修改只改变一行,其余提示词完全保留。团队同时记录提示词版本、修改内容和生成结果,确保偶然出现的好镜头能够被复现。


他们还设定了一条「十到十五次规则」:同一个镜头连续生成十到十五次仍然无法成立,问题大概率已经超出措辞范围。


此时继续往提示词里添加限制,往往只会让模型更混乱。有效的方法是把镜头拆成两段、删掉一个动作、缩小人物活动范围,或者更换机位。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


或者直接把资产从一个人变成一群人,二十名背景人物可以直接做成一个整体资产


怎样把任意一场电影翻译成提示词


沿着这套方法,我们也可以尝试反向解构任何一场电影。


选择一段 30 秒到两分钟的片段,先暂停剧情,只记录画面里能够被验证的事实。


建立资产表:谁出现在画面中?哪些外貌、服装、声音和行为特征需要贯穿每个镜头?角色在这场戏里是否受伤、淋雨或者换过衣服?


画出空间地图:门、窗、桌子、光源和主要道具分别位于哪里?人物距离地标多远?摄影机位于轴线哪一侧?


逐镜头记录摄影信息:景别、机位、焦段、景深、构图、运镜和光线分别是什么?摄影机在跟随人物,还是等待人物进入画面?


把动作放进时间轴:第 0—2 秒发生什么,第 2—5 秒又发生什么?每个时间段只留下一个主要动作。


把情绪翻译成身体动作:角色的目光落在哪里?呼吸是否改变?哪块肌肉先绷紧?手里原本正在做的事,是否因为一句话突然停止?


列出连续性约束:人物数量、站位、衣服、道具、光源方向和伤口位置,哪些内容在下一个镜头里绝对不能变化?


最终得到的提示词,大概会呈现这样的结构:


场景背景:发生了什么,画面中有几个人


角色资产:外貌、服装、声音、行为习惯


空间地图:门窗、地标、人物和摄影机位置


第一帧:画面开始时每个人正在做什么


摄影:景别、焦段、构图、景深和运镜


动作时间线:每几秒发生一个可见动作


物理关系:重量、接触、惯性和受力


光线:唯一主光源及阴影方向


声音:对白、环境声和空间混响


角色表演:目标、隐藏信息、身体节奏和变化


连续性:人数、方向、数量和不可改变的关系


看完这份指南,我只觉得好难。所谓的 AI 电影,也不是大多数人口中仅凭一句提示词,就能做出来的东西。


尤其是看到复杂的镜头设计时,优秀的画家可以用手画出自己脑海中想象的镜头,但 AI 电影创作者则必须要用文字把它们描述出来。


价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片


在社交媒体上发酵了两天,《Hell Grind》最容易被传播的内容,还是开头那几个数字,95 分钟、15 个人和 14 天。


但每一份三四千字的提示词,确实给我们提供了另一种理解 AI 电影的角度。


我们也很难因为一部 AI 电影的公开就说未来都会是 AI 电影的天下,更乐观的情况,大概是希望 AI 电影和动画片、纪录片、剧情片等是作为同一个分类,它们有机会做到各美其美,美美与共。


而这份指南也就有了它存在的价值,让我们入门一个新的电影类别,AI 电影。


文章来自于微信公众号 “APPSO”,作者 “APPSO”

1
AI漫画

【开源免费】ai-comic-factory是一个利用AI生成漫画的创作工具。该项目通过大语言模型和扩散模型的组合使用,可以让没有任何绘画基础的用户完成属于自己的漫画创作。

项目地址:https://github.com/jbilcke-hf/ai-comic-factory?tab=readme-ov-file

在线使用:https://aicomicfactory.app/

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群