前几天,我给自己派了一个任务:用 AI 做一部海外题材的短剧,名字暂定《埃尔多利亚》,第一期先做 01、02 两集。项目标题里写着“新人 AI 练手”,这确实是实话。我既不是专业编剧,也不是视频制作老手,手里只有一台普通电脑、一个写着 minmax h3 的模型入口,以及一套还没被验证过的 AI 短剧制作流程。
按常规思路,接到新项目应该先研究清楚全部功能、参数和案例。但我没有那样做,而是刻意选择了“仅抽卡一次”:只生成一次,用最小代价跑通从设定到画面的整条链路。
这次尝试没有做出什么能拿去参赛的成片,但它让我把一件重要的事情想明白了:AI 短剧的真正门槛,不在于你第一次能生成多惊艳的画面,而在于你能不能把一次偶然的成功,变成一条可以稳定复用的生产流程。下面这些内容,就是我用《埃尔多利亚》这个项目做的一次完整实战复盘。如果你把它当教程,我建议你重点关注的不是具体提示词,而是流程设计、排查顺序和适用边界。
1. 先搞清楚一件事:AI 做“剧”不等于 AI 做“视频”
很多新人对 AI 短剧的第一印象是“丢一句提示词,出一个视频片段”。这个印象没有错,但它很容易带来一个错觉:能生成视频,就等于能制作剧集。
1.1 生成一段视频,和一集剧之间的距离
视频生成只是整条内容生产线里的一个环节。一集剧要成立,至少要做这些事:先有一个能讲清楚的故事,再把它写成适合视觉表达的脚本,然后是角色设定、场景设定、分场逻辑、镜头分镜,再进入画面生成、声音、字幕、剪辑和发布。
这就像一个人想开餐厅,会炒一道菜只是基础能力,还要解决菜单设计、食材供应、出餐效率、服务流程和品控标准。很多新人一上来就追求单帧画面的惊艳,结果做出十几个漂亮片段,却拼不出一集能看懂的剧。因为画面和画面之间没有角色关系、没有空间关系、没有叙事推进,观众看到的只是一堆高度风格化的素材。
所以在我开始《埃尔多利亚》之前,先给自己泼了一盆冷水:我要做的不是“生成几段视频”,而是“生产一集可以被人看懂的剧”。这两件事的难度差着好几个量级。想清楚这一点,很多操作方式都会不一样。比如,我不会一上来就纠结镜头有没有电影感,而是先保证剧情可以被观众理解。
1.2 AI 海外剧的环节拆解
为了不让“做一集剧”这句话变成空泛口号,我给自己梳理了一个最小环节清单。下面这张表是整个项目的基础,后面的每一步都对应其中一个或多个环节。
| 环节 | 产出物 | 新人常见误区 |
|---|---|---|
| 世界观设定 | 一句话或一段背景介绍 | 一上来就写几千字设定,最后镜头完全用不上 |
| 角色设定 | 角色名、外貌、性格、关键道具 | 角色描述太抽象,生成时不稳定 |
| 场景设定 | 每个场景的固定视觉描述 | 每次写镜头都换一套描述,前后不一致 |
| 分场脚本 | 按场次组织的剧本 | 只有对话,没有画面动作 |
| 镜头表 | 镜头序号、景别、画面内容 | 把镜头表当成最终文案,忽略衔接 |
| 画面生成 | 角色图、场景图、动态片段 | 抽卡几次后不记录,后面无法修复 |
| 配音字幕 | 音频、字幕文本 | 画面和语音信息重复 |
| 剪辑合成 | 可播放的成片 | 把所有生成结果按顺序拼在一起,没有节奏 |
新人练手时不需要一次性把每个环节都做得很专业,但至少要意识到,每个环节都是独立存在的。尤其是“镜头表”这一步,很多新人会直接跳过,从文字一步跳到生成画面,最后做出的视频往往是一堆漂亮但没有叙事逻辑的画面。
针对《埃尔多利亚》这种海外题材短剧,我还有一个额外提醒:海外题材不等于堆砌异国元素。角色的行为逻辑、场景的空间关系、道具的视觉细节,都比“看起来像某个地区”更重要。第一版尝试里,我一心想要“有海外感”,结果反而把最基础的故事线索忽略了。
2. “仅抽卡一次”不是偷懒,而是最小成本验证
“抽卡”这个词,经常接触 AI 生成的人都懂。同一个提示词,连续生成几次,结果可能完全不同,因为你面对的是一个带随机性的生成过程。“仅抽卡一次”的意思就是,同一个条件下只试一次,不为了追求更高质量反复调整和重新生成。
2.1 一次抽卡能验证什么
作为新人练习,这个选择我觉得很合理。它最大的意义,是帮你验证“路径”而不是“质量”。抽卡一次,你能观察到的信息包括:
- 模型入口能不能正常返回结果;
- 提示词和输入材料有没有被正确理解;
- 输出格式是否符合预期;
- 从文本到画面的链路是否完整;
- 后续环节能不能接住这个结果。
只要这一条能走通,就说明流程骨架没有大问题。哪怕画面效果一般,也可以继续往下走,去验证配音、字幕、剪辑这些环节。如果一次抽卡效果不错,那当然更好,说明当前方向值得继续投入。如果效果很差,也不用急着换工具,先检查提示词和输入是否准确。
一个关键认知是:抽卡一次是用来“探测流程”的,不是用来“决定质量”的。真正决定作品质感的,是后面反复迭代和工程控制。很多人在第一次抽卡失败后就觉得工具不行,其实可能只是提示词里缺了主体描述,或者输入参考图不够清晰。
2.2 但低成本测试也有明确的边界
“仅抽卡一次”能提供的证据很有限。它验证不了很多东西:
- 稳定性:同一个提示词跑十次,能不能保持同样的成功率;
- 一致性:同一角色在不同镜头里,能不能保持长相近似;
- 批量能力:连续生成几十个镜头,会不会遇到额度、超时、格式问题;
- 失败恢复:生成失败时,是能定位问题,还是只能从头再来;
- 版权与水印:模型生成的素材能否公开或商用,是否带水印;
- 平台审核:生成内容发布后,是否符合平台规范。
这些都需要更长时间的尝试去验证。所以项目标题里的“仅抽卡一次”,是一个很好的“最小实验设计”,但它顶多只完成了第一步。如果把这个当成完整工作流,后面一定会出问题。
打个比方,去一家新餐厅只尝一个招牌菜,能判断这家店值不值得再光顾。但要判断它能不能长期稳定出餐,你还要看后厨流程和管理链路。AI 短剧也一样,第一次抽卡是试菜,不是开餐厅。
注意:仅抽卡一次验证的是路径,不是质量。在继续增加投入之前,先补上稳定性和一致性的测试。
3. 我跑一遍《埃尔多利亚》01+02 集的最小链路
如果你也想做类似尝试,可以参考我这次跑通的最小链路。它不是标准答案,而是一条对新人比较友好的路径。
3.1 先把目标收敛成一个可以验收的最小成片单元
接到《埃尔多利亚》01+02 集这个项目时,我第一反应是做完整规划:先写世界观,再做角色,然后画场景,最后一批批生成镜头。后来我停下来想,这个计划对新人来说太重了。
真正适合新人的做法,是把“剧集”这个大目标缩小到一个可以验收的最小单元。比如,我给自己的定义是:01 集验证“一个主角出场 + 一个环境建立”,02 集验证“两个角色对话 + 一次镜头切换”。不追求完整剧情推进,也不追求高难度动作,只求每个成片单元能完成一个任务。
之所以这样设计,是因为“可以验收”比“看起来高级”更重要。项目一开始就给自己一个允许失败的空间,压力会小很多,迭代周期也会明显变短。如果第一个两分钟成片就想着覆盖完整世界观,很可能才做到第二个镜头,热情就被生成失败耗光了。
3.2 从一句话故事到分镜表
我先写下了一个非常基础的一句话故事:少年在一个边境小城发现了失踪家人留下的徽章,并因此踏上寻找之路。这个题材偏奇幻,正好适合测试海外风格的画面质感。
然后,我把这句话扩展成一个 200 字左右的场景描述。注意,这一步不要写成小说,而要写成“可视化的演出说明”。比如:故事开头,镜头从灰石桥推到少年脸上,他手里的徽章发出微弱蓝光,远处城门已经模糊在黄昏里。
接下来是镜头表。我的记录方式很简单,一张表格就能承载。
| 镜头 | 景别 | 画面内容 | 台词/字幕 | 预计时长 |
|---|---|---|---|---|
| 1 | 远景 | 边境小城全景,黄昏,灰石桥,薄雾 | 无 | 4秒 |
| 2 | 中景 | 少年站在桥头,低头看手中徽章 | “这枚徽章,是我父亲留下的。” | 4秒 |
| 3 | 特写 | 徽章发出微弱蓝光 | 无 | 2秒 |
| 4 | 中近景 | 少年抬头,望向远处的城门 | “我一定要找到他。” | 3秒 |
每一条镜头记录,后续都可以直接作为视频生成的输入描述。镜头表不用做得很复杂,但必须包含三个信息:这段画面里有什么、你想让观众注意什么、画面之间靠什么衔接。少了任何一个,生成出来的片段都会变得碎片化。
3.3 生成阶段:先确认输入,再谈参数
进入生成阶段,最重要的原则是:先确认输入,再谈参数。
我把“镜头画面内容”变成了更完整的提示词。通用结构大概是:主体 + 动作 + 环境 + 光线 + 镜头语言 + 风格。举个例子,针对镜头 2:
一个穿旧旅行斗篷的年轻少年站在灰色石桥上,低头看着手中发出蓝色微光的徽章,黄昏光线,中景,电影感,写实奇幻风格,画面内没有文字和标志。
这段提示词写得很具体,主体明确、动作明确、环境明确、光线明确、镜头语言明确。很多新人喜欢写“一个美丽的少年站在桥边”,这种抽象描述,在生成阶段很难稳定落地。
参数部分,我只会关注几个直接影响结果的设置:宽高比、生成时长、运动强度、随机种子。随机种子尤其重要,它决定同一提示词下结果的稳定程度。如果你的工具支持固定随机种子,一定要记录下每次使用的值。后期想复现一个好看的画面,固定种子是唯一线索。
需要强调的是,不同工具的默认参数差异很大,不要照搬别人文章里的具体数字。先看工具里的参数说明,再根据自己的样例调整。
注意:不要照搬网上的具体参数。很多模型的默认值差异很大,先跑一条样例,再决定怎么调整。
3.4 配音、字幕、剪辑:把碎片变成“可看”的东西
生成出的视频片段,还不能叫剧集。后续还需要配音、字幕、剪辑。
新人阶段,我建议别急着做复杂声音设计。先保证画面里的人物说话时有清晰语音,环境音可以后补。字幕要尽量简洁,不要和台词完全重复。剪辑的原则很简单:每个镜头只传达一个核心信息,镜头之间的切换是“信息推进”,不是为了炫技。观众如果看完一个 30 秒样片,能讲出发生了什么,剪辑任务就完成了。
在《埃尔多利亚》01+02 集这次尝试里,我先完成的不是最终成片,而是一条 30 秒左右的样片。这 30 秒让我知道了:哪些镜头语法可以继续保留,哪些生成提示词还需要修改。
4. 跑通之后,真正的坑才开始浮现
流程跑通,其实只是第一关。后续真正影响项目能不能做下去的,是一致性、稳定性和排查能力。
4.1 角色一致性:最明显的短板
AI 短剧项目做到后面,最大的障碍往往不是画面质量,而是角色一致性。同一个少年在前一个镜头里是黑色卷发,下一个镜头可能就变成棕色直发。这种“崩脸”问题在短视频里尤其致命,因为观众会在几秒内注意到。
处理办法主要有三层。
第一,固定角色描述词。每次生成该角色时,都必须使用同一段外貌描述,不要每次自由发挥。第二,使用参考图。如果你的工具支持角色参考功能,先做一张角色设定图,再基于它生成动态镜头。第三,适当减少对“脸”的依赖。如果工具能力有限,用背影、剪影、局部特写等镜头,可以让一致性压力小一些。
但也要说清楚局限:即使做了参考图,角色一致性也不是 100% 保证。因为生成模型是在概率空间里采样,不是严格按参考图复制。所以每个镜头生成后都要人工检查一遍,不能迷信“有参考图就一定能控住脸”。
4.2 场景和道具连续性
除了角色,场景和道具也会漂移。比如,我前面提到少年手里有一枚发出蓝光的徽章。这个镜头里徽章是圆形,下一个镜头可能就变成方形。城门的建筑结构也可能在几个镜头之间发生微妙变化。
建议在项目开始时就给每一个关键场景和道具建立“设定文本”。每次要生成相关镜头时,直接把设定文本复制进提示词,不要靠记忆重新描述。
另一个技巧是:把颜色、材质、形状这类信息放在提示词里的固定位置。比如所有场景描述都以“场景:”开头,所有角色描述都以“角色:”开头。这样既方便模型理解,也方便你后续排查。一旦某个场景连续出问题,你可以快速找到所有相关镜头,统一修改设定文本而不是逐条重写。
4.3 批量生成、失败重试和记录意识
跑通单条之后,很多人会想直接把 20 个镜头一次性批量生成。我不建议这样做。
我建议的顺序是:先跑 3 到 5 条,观察成功率和效果,确认没有系统性问题后,再扩大批量。因为如果前 3 条就有 2 条出现角色崩坏,说明提示词或参考图设置有问题。这时候应该停下来调整,而不是继续浪费资源。
另外,从第一次尝试开始就要养成记录习惯。记录内容包括:提示词版本、参数设置、生成结果、是否满意、问题描述、下一步修改方向。记录不需要很复杂,一张表格就能解决。
| 任务 | 模型入口 | 提示词版本 | 参数 | 状态 | 问题 | 下一版调整 |
|---|---|---|---|---|---|---|
| 镜头1 | minmax h3 | v1 | 宽高比16:9,4秒 | 成功 | 画面偏暗 | 提示词加“暖色光线” |
| 镜头2 | minmax h3 | v1 | 宽高比16:9,4秒 | 失败 | 角色年龄偏大 | 角色描述加“18岁左右” |
有了记录,你才能做“单一变量排查”。否则出了问题,你根本不知道是提示词、参数还是输入素材造成的。
4.4 一个相对好用的排查顺序
如果生成结果异常,我一般按下面这个顺序排查,而不是直接改提示词:
- 看现象。先搞清楚异常是哪种:直接报错、长时间无结果、画面黑屏、角色崩坏、画风突变,还是画面里出现乱码文字。
- 看输入。提示词是否完整,有没有拼写错误;参考图是否清晰;文本编码是否异常;有没有无意引用了失效素材。
- 看参数。宽高比、时长、运动强度、随机种子是否设置合理;是否使用了和内容不匹配的模板。
- 看工具条件。额度是否用完;输出格式是否被后续环节支持;有没有水印或版权提示。
- 看预期。这个要求是不是超出了工具的当前能力,比如让 5 秒片段里完成复杂打斗和多人对话。
这个排查顺序的核心是:先排除输入问题,再检查环境,最后才回到参数和模型能力。这样能避免每次都在盲目调参数。
注意:当结果异常时,优先排查输入和条件,再修改提示词或参数。很多时候问题根本不在模型能力,而在输入材料或参数设置。
5. 新人的 AI 短剧工作流,怎么判断能不能继续投入
跑完一轮后,你需要一个判断标准,来决定这个方向值不值得继续投入。我一般用五个指标来判断。
5.1 可复用性
一个工作流能不能继续用,先看它是否可复用。你在《埃尔多利亚》里整理的角色设定文本、场景设定文本、分镜表模板和提示词结构,换一个剧本能不能继续用?
如果可以,说明这不是一次临时操作,而是一套可以沉淀的方法。我的判断依据很简单:下一次项目开始时,如果不是从头摸索,而是直接套用上一次的表格模板和提示词结构,就说明流程开始具备复用价值了。可复用性是第一个指标,也是后面所有指标的基础。
5.2 可排查性
第二个指标是,出了问题能不能快速定位。一个健康的流程,应该允许你把“哪一步有问题”找出来。比如画面崩了,是角色描述不一致,还是参考图失效;视频卡顿,是片段帧率不对,还是剪辑工程太重。
如果流程混乱到无法判断问题出在哪个环节,那生成效果再好,也不适合长期投入。因为你每次都在用运气做项目,而不是用方法。
5.3 质量可控性
质量可控,不是指每一次都 100 分,而是指你能在可接受的范围内保持稳定。你可以接受多少比例的失败镜头;失败之后重试的成本是多少;哪些瑕疵可以通过剪辑规避。
如果你在十次生成里成功一次,但完全不知道成功原因,那质量不可控。反过来,如果成功率还说得过去,且失败原因可解释,质量就是可控的。所谓“可控”,不是消灭随机性,而是让随机性成为你可理解、可管理的变量。
5.4 可迭代性
迭代能力决定了这个项目能走多远。每次生成结果都需要被审视:哪里好、哪里差、下一版怎么改。
我把这个过程称为“版本更新”。给每个重要的提示词和镜头方案编号,记录每一次修改原因。这样,你的 AI 短剧项目就不是一个平面堆积的文件集,而是有历史版本的目录。下次想回退到某个风格,或者想看看某个参数改之前和之后的差别,都一目了然。
5.5 内容安全与版权边界
还有一个很容易被忽略的指标:材料合规性。做 AI 短剧,尤其是有可能发布到公开平台时,要提前确认:
- 生成素材是否满足平台的内容规范;
- 角色和故事是否涉及侵权风险;
- 使用到的模型是否允许生成内容用于公开或商业发布;
- 是否需要对 AI 生成内容做明确标注。
这些不是限制创作,而是避免项目做到一半突然被叫停。尤其对于海外题材项目,如果涉及真实文化符号、历史人物或已有 IP,更要小心。与其最后返工,不如在项目开始时就把合规边界列进检查清单。
6. 给同样想试 AI 短剧的新人,一条更稳妥的路径
最后说说,如果给你也准备做一个类似的 AI 短剧尝试,我建议从什么地方开始。
6.1 先做一个 30 秒样片
很多人的第一反应是“我要做一部完整的剧”,然后开始写十集大纲。我的建议是反过来:先做一个 30 秒的样片。
样片不需要完整剧情,只需要解决三个问题:主角长什么样、主要场景是什么、氛围靠什么建立。30 秒已经足够暴露问题了。如果 30 秒的样片能做出来,且你能讲清楚它讲了什么,再做完整两集就不难。如果 30 秒都做得磕磕绊绊,那就证明流程还没稳,需要继续调试,而不是继续堆量。
6.2 先处理文本,再处理画面
很多新人会急着看到画面,于是跳过文本,直接写提示词。结果生成出来的片段彼此之间没有叙事关系,最后成了一堆素材,而不是一集剧。
我更推荐先写一句话故事,再扩展成场景描述,再拆成分镜表。文本层面的调整成本最低,等到画面生成之后再改文本,代价会高很多。这也是我这次《埃尔多利亚》尝试中最受益的一点:先花一个小时把文本和分镜理顺,后面的生成和剪辑都会省力很多。
6.3 每次只改变一个变量
这是老生常谈,但真正能坚持的人很少。AI 生成结果不稳定,如果你同时改了提示词、模型、参数和参考图,一旦效果变好,你无法知道是哪个变量起作用;一旦效果变差,你也不知道该回退到哪里。
所以每轮迭代只改一个变量,最少跑两次,再做判断。比如这一轮只改“光线描述”,下一轮只改“运动强度”。这样积累出来的经验,才是有效经验,而不是一堆无法解释的偶然成功。
6.4 把“抽卡”当成流程测试,而不是创作终点
回到“仅抽卡一次”这个话题。抽卡能帮你快速验证流程,但它不应该成为创作的核心方法。如果你每一次创作都要靠抽卡抽到满意为止,那你实际上是被随机性控制,而不是在控制创作。
更合理的做法是:用一次或几次抽卡来探测流程,找到方向后,立刻进入确定性更高的流程,比如固定角色设定、固定提示词、固定随机种子、建立版本记录。到这个时候,AI 短剧这件事才算真正开始:不是靠运气生成一个好看的画面,而是通过可控的流程稳定地做出一个能看懂的剧集。
这次《埃尔多利亚》01+02 集的尝试,我最终没有追求“一次性抽到完美成片”,而是把注意力放在了“能不能把一次成功复制成十次”上。用一句话总结就是:AI 短剧真正值得投入的地方,不是让你用一次偶然惊艳别人,而是让你能稳定地把一集内容做出来。对新人和老手来说,这一点同样成立。