IMG-LOGO

AI电影工业流程完全教程:《HELL GRIND》11.5万条工程记录的实战拆解

邹叔 邹叔 2026-08-10 6 Views

AI视频平台 Higgsfield 做了一件非常夸张的事。

他们不但公开了一部95分钟的AI电影《HELL GRIND》,

还把这部电影背后的工程文件一起公开了。

约11.5万次生成记录,按场次建立文件夹,每一笔记录都可以查看参考图、完整提示词、模型、分辨率、生成日期,并下载结果。

里面能看到角色素材、道具、环境参考,也包括大量失败版本和重新生成记录。


01


今天邹叔帮你讲这个工程文件拆解开,变成一份AI电影工业流程完全教程,这份教材不是"赏析"这部片子,而是把它的制作流程拆成可以照着做的步骤

每一步都有 Hell Grind 项目的真实做法作为案例支撑,每一步都有可以直接复用的模板。

读完这篇教程,你将掌握:

步骤一:如何搭建 Elements 资产库,让角色/服装/武器/场景变成可重复调用的固定资产

步骤二:如何把一场戏拆成"机器可执行的分镜脚本"(含8秒动作镜头完整拆解案例)

步骤三:如何组织批量生成、筛选和版本管理

步骤四:如何完成从 Prompt 到成片的后半程,剪辑、声音、后期

步骤五:如何做预算规划和团队协作

第一部分:打破幻觉——AI电影不是"一句话的事"

在 Hell Grind 的制作过程中,仅前25分钟的内容,团队就:

生成了16,181段视频

最终采用了253个镜头

可用率不到2%

筛选比约为64 : 1

也就是说,每64次生成中,只有1次能达到导演的及格线。整个项目累计约11.5万次生成记录,按场次建立文件夹,包含角色、场景、道具、测试素材、失败版本和重新生成的全部历史。

这意味着什么?


2


制作团队说明


3


导演 Aitore Zholdaskali,前作《Sicko》入选鹿特丹电影节 Bright Future 单元、SXSW 伦敦 2026。

联合编剧 Adilkhan Yerzhanov 曾两次入选戛纳电影节官方单元。

团队核心具有传统电影工业经验,而非纯技术背景。

全流程总览:AI电影制作的六阶段管线

在深入每一个步骤之前,先建立一个全局视角。


4


关键提示:这个管线不是线性的,Phase 3 中的失败镜头会回退到 Phase 2 调整资产,Phase 4 发现的问题也可能触发 Phase 3 的重新生成。它是一个迭代循环,不是流水线。第二部分:步骤一搭建 Elements 资产库核心理念:AI电影需要"固定资产"

传统影视制作中,一部电影的服装、道具、场景都是实物。

拍完一场戏,第二天还能拉出来继续用。

但在AI视频领域,每次生成都是 "从零画一张新图"。

如果不做任何资产锁定,同一角色在下一场戏里就会变成另一个人。

Hell Grind 团队的解法是:先把角色、服装、武器和场景制作成可以重复调用的 Elements。

写提示词时,不再反复描述人物,而是直接引用这些固定资产。


5


Hell Grind 角色资产案例

以主角ROKO为例,团队为其创建的资产包括:


6

07


实操清单:你的 Elements 资产库搭建检查表

在开始生成任何视频之前,确认以下资产已就绪:

每位常驻角色:20+参考图已入库,Soul ID已训练

角色状态矩阵(正常/受伤/战斗/情绪)已完成

每个状态的文字描述(精确到伤口位置和服装破损程度)

每个核心场景:主图 + 多角度参考已生成

剧情版本变体(至少初始版/破坏版/情绪版)已完成

复杂场景的低模已完成

每个关键道具:多角度参考图 + 状态变化已记录

全局视觉规范:色彩方案、光照方案、运镜风格已确定

关键原则:生成一帧视频之前,先花足够时间把资产做扎实。

Hell Grind 团队的一个重要教训是,如果生成到一半才发现角色不一致,回头重建的成本远高于前期投入。


8


第三部分:步骤二从分镜到"机器可执行的提示词"

重新定义"提示词":它不是描述,是指令

这是本教程最核心的一章。

Hell Grind 项目最颠覆认知的地方,不是生成了多少视频,而是他们的提示词已经进化成了一种机器可执行的分镜脚本

传统的AI视频提示词通常是这样写的:

"A cinematic shot of a warrior in a dark museum, dramatic lighting, 4K, photorealistic."

而 Hell Grind 团队的同类型提示词约为后者的12倍长度,但它不是废话填充。

每一个词的增加,都是在缩小AI模型的自由发挥空间,从而提升可控性。

提示词工程的七段骨架

从 Hell Grind 的4万多条公开提示词中,小互团队统计出了一个在所有长提示词中一致存在的结构。

这个结构相当于一份微型拍摄通告


9


案例:一个8秒动作镜头的完整拆解

下面以 Hell Grind 中一个典型特效动作镜头为例,展示从分镜意图到完整提示词的最终形态——单条提示词组装完成后约 2,500-3,500 英文词。

分镜意图(人读)

场景:野蛮主义圆形混凝土博物馆大厅。镜头:3.6 米高的怪物背贴炸弹,挣扎后引爆,蘑菇云升腾。时长:8 秒。景别:广角→超广角(手持拉远)。情绪:挣扎→爆炸→烟尘弥漫。


10


完整提示词(组装后可直接使用的最终输出,中英对照)

连续手持长镜头——8秒·21:9·8K IMAX·单镜到底从第0帧到最后一帧·无硬切·24fps平滑运动·180°快门运动模糊·物理电影镜头。

写实电影感——无3D渲染、无游戏引擎、无游戏过场动画感。仅真实片场摄影质感。

摄影风格:艾曼努尔·卢贝兹基 × 罗杰·狄金斯。

灯光:仅自然光——博物馆天窗上方逆光,摄影机置于怪物阴影一侧,全场大气雾霾。无人工电影灯、无主辅光系统、无反光板、无额外光源,仅场景内固有光源(琥珀色展柜灯光)。 

场景: 一座巨型野兽派圆形混凝土博物馆大厅。尺寸:圆形平面直径约22-24米,层高约10-12米。宽阔灰色混凝土地面,高耸混凝土墙面,上方约8-10米处排列一列狭窄竖条窗。摄影机左侧一根混凝土柱(约80cm见方)。四座八角形立式展柜(约2.5米宽、1.0-1.2米高)散落在宽环中——每座分为厚重的混凝土金属底座(固定不可动,内置琥珀色灯光)和较轻的玻璃顶盖(拍摄前已碎裂)。两座普通矩形展柜嵌于对侧深色墙面壁柱中。2-3棵深叶室内树木置于厚重混凝土花盆中,散布于周边。二层环形阳台环绕上方。中心空地——怪物站立之处。 

角色——怪物: 高3.6米。粉红皮革质感肌肉人形体,沧桑皱纹皮肤,裸露上身,腰间缠破旧深色缠腰布。骨刺(20-30cm,淡黄风化骨色)从肩部和脊柱呈扇形外展。骷髅面孔——下半张脸血肉剥离至骨骼,裸露泛黄牙列形成永恒咧嘴;上半张脸为蜡黄人类皮肤,深陷的黄绿色湿润活眼。长而凌乱的深黑色头发垂至上背。不对称双臂:左臂——正常肌肉人形手臂,五指带锋利黑色爪尖。右臂——骨生物变异臂——一柄长弯骨刃(50-60cm,骨质角蛋白)从肘部融合延伸。1500-2000kg体型重量压入混凝土地面。 

道具——炸弹(仅一枚): 哑光灰色陶土球体——直径恰好30厘米(约人头大小,约怪物3.6m身高的1/12)。粗糙多孔无光灰陶表面——哑光、矿物质感、灰白色。球体顶部有短窄柱状颈口(约4-5cm高,如小烟囱,边缘参差不齐)。整个表面布满重度裂纹网络,裂缝深而宽。活跃内部辉光——第0帧起即从每一道裂缝中脉冲出明亮的橙白熔岩光,前三秒持续增强。第0帧时,炸弹已粘着/融合于怪物上背两枚脊柱骨刺之间。

配色规则 60:30:10: 60%冷灰混凝土(地面、墙面、柱体、天花)。30%暖琥珀来自场景内展柜辉光 + 粉红怪物皮肤 + 深灰绿树叶。10%橙红爆炸光在第3-4秒 + 深黑烟云在第4-8秒。 

灯光——逆光+阴影侧: 摄影机位置使天窗日光朝镜头倾泻。怪物处于逆光——头部/肩部/骨刺/背部形成明亮轮廓光,面向摄影机的正面处于深阴影中。主光仅来自天空和窗户。无反光板、无补光灯。大气雾霾——可见的冷光柱从天窗切下穿过尘雾空间。 

动作——连续不间断时间线: 

0.0-1.5秒——广角镜头:摄影机位于怪物南侧约10米,成人眼高度(约1.6米),微仰拍摄。怪物3.6米全高完整可见,立于圆心正中。他剧烈扭身试图够到自己的后背——右侧骨生物变异臂从头顶弯向炸弹,左侧正常手从另一肩翻上抓向球体。他通过裸露颌骨牙齿大声咆哮,嘴极度张开,深陷的双眼饱含警觉与暴怒。炸弹明显处于激活状态——明亮的橙白熔光从裂缝中脉动射出,肉眼可见已经灼热、已进入待爆状态。 

1.5-3.0秒——剧烈挣扎+摄影机拉远:怪物猛烈扑腾——骨爪从一肩上抓刮球体,正常手从另一肩抓握。咆哮的音量和音高持续攀升。橙光增强。摄影机向南从约10米拉至约13-14米——怪物在画面中明显缩小,更多博物馆建筑进入画框。约2.5秒时摄影机滑入二层阳台挑檐下方——深色挑檐底面进入画面上方框。 

3.0-4.0秒——引爆:炸弹在怪物上背原位引爆——极大规模、迅猛、瞬时。首帧(约0.05-0.15秒,180°快门模糊下):硬脆开裂的橙白闪光以肩胛骨间位置为中心绽开,火球在前0.2秒内达到5-6米直径。怪物在前0.3秒内完全被爆炸吞没——在火球后不可见。摄影机剧烈反应:硬镜头震动冲击,猛烈8-10°倾斜构图,5-7次强烈阻尼抖动,被冲击波推开约1-2米。冲击波物理席卷全馆:八角展柜的玻璃顶盖炸飞(底座锚定不动),地面上碎玻璃向外飞散,树木猛烈摇摆树叶四散,墙面展柜玻璃开裂部分碎裂,阳台挑檐抖落混凝土粉尘。 

4.0-7.0秒——黑色蘑菇云:厚重黑烟从怪物位置翻涌升腾。蘑菇云总高度:6-8米(约怪物身高的1.7-2.2倍)。可辨识的垂直烟柱+翻涌冠顶。烟云吞没怪物——前约0.5秒内可见其暗影轮廓,随即消失。摄影机持续抖动并重新稳住。 

7.0-8.0秒——最终帧:6-8米蘑菇云占据画面正中心。冠顶缓慢涡旋翻涌,烟柱底部展宽,浓烟在混凝土地面上翻滚。极微弱的内部橙光在烟柱底部深处脉动。怪物在云后不可见。一些博物馆元素在浓雾中于画面边缘隐约可辨。摄影机稳住,沉淀。镜头于8.0秒结束。 ?摄影机:全手持——不平滑、不稳定。真人掌机——呼吸抖动、身体漂移、微倾斜。绝不滑顺、绝无轨道。无稳定器顺滑、无摇臂。镜头在掌机手中是活的。全程180°快门运动模糊。画面:第0帧广角(约10米)→第8帧超广角(约15-18米),摄影机朝北拍摄逆着天窗逆光日光。 

风格:8K IMAX。写实——无3D渲染、无游戏引擎、无游戏过场动画感。

摄影:卢贝兹基 × 狄金斯。

皮肤:毛孔级真实——汗毛、不对称痣、毛细血管透红、毛孔阴影匹配现场光源。

表演:好莱坞级——反应前微停顿、精准视线、湿润活眼带反光点、可见呼吸和胸口起伏。

物理:重力和惯性贯穿——质量有真实重量、接触阴影正确。无漂浮道具。

构图:三分法+黄金比例。每个人从第一帧就在动。

连续性:角色、道具、环境贯通全镜完全一致。无身份漂移。

技术:24fps平滑运动。8K细节。除刻意手持外无抖动。

音频:仅环境音效——天窗缝隙冷风微啸、混凝土空间低沉环境嗡鸣、利爪脚掌在混凝土上刮蹭、怪物的响亮咆哮怒吼、引爆瞬间炸裂的惊雷爆响、沸腾浓烟、碎屑裂响。无配乐。无字幕。

技术底座详解(12行通用规范)

从41,083条提示词中高频提取出的通用底座。它不是"建议",而是每条提示词末尾的固定组件:


11


第四部分:步骤三批量生成、筛选与版本管理

生成节奏:不追求一次命中

Hell Grind 团队采用的不是"精心打磨一条提示词然后生成3次挑最好的",而是高频低期待策略:

每次生成长度以8-15秒为单位,

每20次生成中挑选3-4个最优片段(约5:1到7:1的组内筛选比),

全局约64次生成产出1个可用镜头,

多个导演同时在不同场次并行生成共用资产库,

失败版本不直接删除而保留在工程文件中作为"禁区参考"。

8-15秒是因为当前主流AI视频模型在超过30秒后,

角色身份和光照一致性会显著下降;

短片段在后期剪辑中更容易衔接;

可以用"首尾帧匹配"策略串联;

坏了一小段只需重新生成这一段。

筛选标准

12


版本管理:工程文件夹结构

Hell Grind 公开的工程文件采用了以下结构:

00_MASTER_ASSETS/Characters / Environments / Props(最终确认的资产)

01_SCENE_01_MUSEUM_HEIST/storyboard + shot_001~shot_N(每镜独立文件夹)

shot_001/内含:prompt_v1.txt + gen_001~064.mp4 + SELECTED_gen_041.mp4 + shot_notes.md

99_POST_PRODUCTION/ edit_timeline / color_grade / audio_mix / fix_log.md

关键管理原则:失败版本保留不删(标注FAILED_前缀用于分析模型行为);每镜维护shot_notes.md(记录为什么选这版、其他版本的问题、可重用参数);资产与场次分离;只有剪辑导演有权将素材移入后期。

第五部分:步骤四后半程:从 Prompt 到成片

为什么AI电影的后半程需要真人

目前AI视频模型的能力边界在于"局部15秒",而不在于"全局95分钟"。

剪辑、声音设计、色彩匹配、AI痕迹柔化、连续性修复这五项工作AI目前无法可靠完成。


13


AI 的工作是"大量生成",人的工作是"精准选择"。11.5万次生成不是AI能力的证明,是人筛选能力的证明。

第六部分:步骤五预算规划与团队协作

AI电影的真实成本模型

对比:传统同等规格CGI动作片$5,000万 - 1.5亿,成本差约100倍。

14天冲刺时间表(参考 Hell Grind 实际排期)


15


第七部分:常见问题与风险防范

角色一致性问题(四层防御)

第一层:Soul ID 训练,20+多角度参考图,一次性训练,每次生成必须附加该ID。

第二层:资产描述一致性,所有镜头使用统一的角色描述模板,从主资产文档复制粘贴。

第三层:提示词中的面部分解指令,Skin段(汗毛、痣、毛细血管、毛孔阴影)+ Acting段(微停顿、视线、湿润眼睛、呼吸)。

第四层:后期修正,DaVinci Resolve色彩匹配拉近面部色调,极端情况重新生成。

物理穿帮问题(最高频翻车点)

排名1:脚不沾地/漂浮(预防:提示词写"boot sole compression against floor")。

排名2:道具悬浮(预防:技术底座Physics行"No floating props")。

排名3:接触阴影缺失(预防:写"correct contact shadows under every object")。

排名4:质量感缺失(预防:写"mass has real weight" + 物体落地要有反弹/碎裂)。

排名5:人物比例异常(预防:站位段写明身高距离)。

"AI塑料光泽"问题(三层去味)

提示词层:Style行禁3D渲染和游戏引擎,Skin行写毛孔级真实感,Lighting行自然光优先。

生成策略层:优先选择有轻微瑕疵的版本(面部不对称、衣服皱褶、灰尘颗粒)。

后期处理层:DaVinci Resolve添加Film Grain(15-25%) + Vignette + Soft Glow + Micro Contrast。

第八部分:可复用的模板与速查卡

技术底座(直接复制使用)

Style: 8K IMAX. Photorealistic — no 3D render, no game engine, ? no game-cutscene aesthetic. Cinematography: Emmanuel Lubezki × Roger Deakins. Camera: Physical cine lens. 180° shutter motion blur. Lighting: Natural light only — contre-jour backlight, camera on ? shadow side, atmospheric haze throughout. Color: 60:30:10 — dominant / secondary / accent. Skin: Pore-level realism — vellus hair, asymmetric moles, ? capillary flush, pore-shadow matching on-set light. Physics: Gravity and inertia respected — mass has real weight, ? correct contact shadows. No floating props. Acting: Hollywood — micro-pauses before reactions, precise ? eye-line, wet living eyes with catch-lights, visible breath. Composition: Rule of thirds + golden ratio. Every person moving ? from frame one. Continuity: Characters, props, environment identical across ? every cut. No identity drift. Technical: 24fps smooth motion. 8K detail. No jitter. Audio: Environmental SFX only. No music. No subtitles.

禁令速查清单(每次生成前核对)

无背景音乐(指定 Scene 需要配乐的情况除外)

无自动字幕

无随机路人

无角色重复(同一人不能出现两次)

无漂浮(所有物体接地,有接触阴影)

无游戏CG感

无塑料/光滑表面

无镜头光晕(需要的情况除外)

无慢动作(需要的情况除外)

对话严格按指定内容(不能自由发挥)

第九部分:当我们看完这套流程,看到了什么

这份教程很重。

11.5 万次生成、15 人 14 天、64:1 的筛选比、16,501 字符的中位数提示词——如果你是从头读到这里的,你应该已经感受到了:AI 电影这件事,和大部分人想象的不一样

那不是"AI 能不能做电影"的问题。那是一个根本不成立的问题。真正的问题藏在那些工程文件里

AI 不会替你思考,它只会放大你的思考

Hell Grind 的提示词最震撼的地方,不是它有多长。是它把"导演脑子里想的东西"用一套可执行的语法写了出来。

角色此刻身上什么伤、衣服破在哪一镜造成的、汗从哪个部位往下流、呼吸节奏是快是慢、视线先看哪里后看哪里、灯光是双光源还是单光源、色温多少K,这些不是"AI 需要的",是导演需要想清楚的

AI 做的事情,是把你想清楚了的东西变成画面。

你没想清楚的东西,AI 帮你变成一堆随机画面。那 64 次生成里被淘汰的 63 次,不是 AI 不够好,是你没跟它说清楚。

那些写得像微型拍摄通告一样的提示词,本质上是一个导演的思维外化,你把脑子里的画面拆成动作节拍、灯光参数、站位坐标、禁令清单,AI 才能把你脑子里的画面还原出来。

这件事告诉我们:AI 时代最稀缺的能力,不是会用哪个模型,是能把自己的想法拆成可执行的指令。

这门手艺,叫"导演",不叫"提示词工程师"。

流程比工具重要一百倍

这个项目最值钱的开源内容,不是某一条提示词,不是某一个模型参数,是那 108 个按场次编号的文件夹。

00_MASTER_ASSETS/?→?01_SCENE_01/?→?shot_001/?→?prompt.txt + gen_001~064.mp4 + SELECTED_ + shot_notes.md

这个文件夹结构,就是一部 AI 电影的骨架。

它回答了所有"怎么做"的问题:

角色怎么做——先建资产库再调用;

分镜怎么做——七段骨架填进去;

生成怎么管——每镜一个文件夹,64 次生成全保留;

筛选怎么判——P0 一票否决 / P1 一票否决 / P2 降级使用 / P3 标注修复;

后期怎么接——fix_log.md 记下 40 个修复点。

那些一个人拿 AI 工具三天做出一个短片的 demo,炫是很炫。

但如果你要的是"稳定地、可重复地、团队协作地"做出 95 分钟的东西,你需要的不是更快的模型,是更稳的流程。

人没有被替代,人被重新定义了

15 个人的团队。

导演、DP、剪辑导演、资产设计师、场次导演。没有人被 AI 替代,但每个人的工作内容变了。

导演不再事必躬亲地画每一帧,而是把"脑子里想要的画面"翻译成 AI 能执行的指令。

DP 不再扛着摄影机在片场跑,而是在提示词里写"35mm 镜头、180° 快门、推轨速度匹配转身速度"。

剪辑导演不再从几十个小时的素材里翻找,而是从 11.5 万次生成里挑选那 253 个能用的镜头。

角色变了,但人没消失。

Hell Grind 团队的核心,导演 Aitore Zholdaskali,前作入选过鹿特丹电影节。联合编剧入选过两次戛纳。他们不是"被 AI 赋能的外行",是本来就懂电影的人,学会了用 AI 做电影

这对所有创作者的意义是:AI 不会让外行一夜之间变成导演。但它会让真正懂行的人,一个人拥有过去一个团队的生产力。

这份教程真正的价值

这份教程的目的不是让你复制一部 Hell Grind。

是你下一次打开一个 AI 视频工具的时候,脑子里不再只有"写一句提示词,看它生成什么"。

而是你开始想:这个角色我有没有建资产库?这场戏我有没有拆成分镜节拍?这条提示词里我写没写站位几何和灯光色温?我有没有给模型写禁令?

从"让它生成"到"让它执行",这一个字的差别,就是玩 AI 和用 AI 的分界线。

11.5 万次生成换 95 分钟成片。

64 次生成里只有 1 次能用。

这个比例放在任何一个传统行业都是不可接受的,除了电影。

因为在电影里,一条能用的镜头,值剩下的 63 条废片。在

电影里,精雕细琢不叫"效率低",叫"创作"。

所以当有人再问你"AI 能不能做电影"的时候,你已经知道了答案。

不是能不能。是你会不会。是你的流程硬不硬。

是你的资产库有没有搭。

是你的提示词里写没写那些看起来啰嗦、但每一条都在缩小 AI 自由发挥空间的东西。

AI 不会替你做一个好导演。但一个好导演,值得用 AI 放大自己。

附录

术语对照表


16

相关链接

17



分享到: