先说结论:这套“即梦 + 豆包 + 剪映”的组合,是我目前跑下来最顺手的 AI 动画短剧生产链路。很多人以为难点在于“怎么生成一张好看的图”,实际上真正拉开差距的是:你能不能把一条创意稳定地变成几十个镜头,再让角色在镜头之间不跑偏,最后用剪辑把节奏救回来。
这篇文章不是教你怎么点按钮,而是把我连续做了三条 AI 短剧后验证过的完整流程拆给你看。不论你是完全零基础的新手,还是已经会剪辑但想切入 AI 短剧赛道的创作者,只要跟着这个流程走一遍,第一天能出粗糙成品,第二天能做完整故事,第三天就可以开始谈报价。
我会把分镜脚本模板、角色设计提示词、镜头语言拆解表、即梦的提示词公式、剪映的成片自检清单都放在对应章节里,你需要做的就是把它们复制到自己的文档里,边做边填。
1. 这套组合拳的底层逻辑:即梦负责“画”,豆包负责“想”,剪映负责“剪”
1.1 三条流水线,别让工具越权
我最初也犯过一个错误:试图用即梦写剧本,用它生成分镜表,结果越写越乱。原因很简单,即梦的核心能力是图像和视频生成,它可以画出“雨夜里撑伞的男人”,但它不太擅长帮你梳理“这个男人为什么出现在雨夜里,他的动机是什么,下一幕要发生什么”。
豆包才是那个负责“想”的角色。它擅长把一段零散的想法结构化,比如你说“我要做一条关于外卖员穿越的短剧”,它能帮你拆成“三幕结构”“十个关键情节点”甚至“每一段的情绪曲线”,还能直接输出可以喂给即梦的画面描述。
剪映负责最后的一切整理:片段排序、配音、BGM、音效、字幕、调色、转场。我见过有人在即梦里反复调提示词想达到“剪辑感”,那是在拿一把菜刀掏耳勺,费劲且不专业。正确逻辑是:即梦只负责把单张画面和短片段做到最好,至于怎么串联、怎么卡点、怎么配乐,全部丢给剪映。
这套分工一旦想清楚,效率是翻倍的,因为每个工具都只做自己最擅长的事,你不会再花一小时纠结某个工具里“这个功能到底怎么用来代替另一个工具”。
1.2 目标定义:你在做的究竟是哪种 AI 短剧
动手之前,先把“短剧”两个字再拆细一点。同样是 AI 短剧,市面上至少有两类,技术路径完全不同:
一类是漫剧/剧情动画短片,比如两三分钟内的诡异反转、情感共鸣、科幻片段,强调人物表演、镜头连续性、情绪递进。它需要更精细的角色设计、镜头语言和前后一致性,制作成本高,但辨识度也高。
另一类是AI 解说/图文转视频,最常见的形式是博主用 AI 生成画面,配上真人声音或者有声书式旁白,内容偏“讲故事”。这类对单张画面的质量要求高,但对镜头连续性的要求低一些,可以用相对固定的模板批量产出,适合练手和走量。
我建议第一天不要贪心,明确告诉自己:先做出“一条 30 秒以内的剧情动画短片”,把完整链路跑通,再考虑做复杂叙事还是大批量解说。
1.3 环境准备:笔记本就行,但这些流程要先搭好
这套流程完全是云端为主,所以我用普通的办公笔记本也能完成,不需要专业显卡。真正需要提前准备的是这么几件事:
- 账号体系:即梦、豆包、剪映各自注册好,并且尽量让三者的登录账号在同一套手机号体系下,导出素材时路径更清晰。
- 文件夹结构:这是我踩过最大的坑。做了两周之后,素材乱到我自己都找不到哪张图对应哪个镜头。现在我的标准结构是这样:
project/ai_short_drama/ 01_storyboard 分镜脚本 02_characters 人物定妆图 03_scenes 场景概念图 04_video 生成视频片段 05_audio 配音与音乐 06_edit 剪映工程与导出- 时间预算:别以为自己一天就能产出一条大片。我做第一条 30 秒短片,实际花了大概 5 个小时,其中分镜和角色设计占了一半时间。到第三条的时候,全流程压缩到了两个小时左右。这才是“3 天学完”的真实节奏——不是第三天突然成交,而是第三天你已经能稳定用两小时交付一个短样片。
2. 分镜脚本:让豆包把“一个念头”拆成“一份能拍的画面清单”
2.1 给豆包的输入不是一句简单要求,而是角色+需求+风格三件套
分镜脚本是整个项目的图纸,图纸如果模糊,后面出图、剪辑、配音全部跟着歪。
很多人让豆包写分镜,只丢一句话:“帮我写一个悬疑短剧的分镜”,回来的东西多半是空泛的“主角走进老宅——发现秘密——惊慌逃跑”,这种脚本拿去给即梦生成画面,你会发现镜头之间毫无逻辑,人物姿态和情绪对不上。
正确的做法是,先给豆包喂一个“输入包”,包含三样东西:角色、需求、风格。我用一个实际例子示范:
角色:28岁女性程序员,银色短发,蓝色风衣,戴圆框眼镜,性格冷静但有点社恐 需求:创作一条30秒竖屏AI短剧分镜脚本,剧情完整,结尾有反转 风格:赛博都市,冷色调,二维插画质感,节奏快,镜头数15到20个 输出要求:每个镜头包含镜头编号、景别、画面内容、台词、时长把这段话丢给豆包之后,它会吐给你一个相对规整的分镜表。但这只是初稿。我会要求它继续细化两轮:第一轮把“画面内容”改成更可视化的描述,比如“她抬头,手指停在键盘上,窗外蓝光一闪”;第二轮把每个镜头的时长和情绪节奏标出来。
2.2 实战分镜模板:拿“深夜办公室遭遇”当例子
下面是我用这套方法让豆包生成的一个简化版分镜表,已经经过我的人工修改,你可以直接拿来做参考格式。场景是一条 20 秒悬疑短片。
| 镜头编号 | 景别 | 画面内容 | 台词/音效 | 时长 |
|---|---|---|---|---|
| S01 | 全景 | 深夜办公室,只有一盏台灯,她坐在电脑前 | 键盘敲击声 | 3s |
| S02 | 特写 | 她听到门外声音,瞳孔忽然放大 | 安静,玻璃响 | 2s |
| S03 | 中景 | 她缓缓转头,视线看向办公室门口 | 呼吸声 | 3s |
| S04 | 全景 | 门口站着一个和她穿同样衣服的人影 | 低频音效 | 3s |
| S05 | 特写 | 她吓得往后一靠,椅子发出刺耳声 | 椅子摩擦声 | 2s |
| S06 | 中景 | 门口人影往前一步,灯光忽明忽暗 | 电流音 | 3s |
| S07 | 特写 | 她摘掉眼镜,嘴角浮出一丝笑 | “终于来了。” | 4s |
你看,这张表已经可以直接指导后面的所有工作。每个镜头都有数字编号,这个编号在后续的素材管理里就是身份证号。
2.3 为什么镜头编号要提前排好
没有做过项目的人很难理解为什么我要在分镜阶段就死磕编号。等到了第 5 章,你会在即梦里生成几十张图、几十段视频,如果每张素材都叫“图1”“图2”,你会完全乱套。但如果你从一开始就把所有素材命名为“S03_全景_取景2”,那在剪映时间轴上,只需要按文件名排序,镜头顺序自己就出来了。
这是三个工具协作的核心秘密:保持一套统一的命名规范,贯穿分镜表、即梦素材和剪映时间轴。
2.4 分镜表整理成文档
豆包生成的分镜表,我不建议直接保存在聊天记录里。最好复制到自己的表格软件里,整理成规整的表格,再在右侧加两列:“即梦画面描述”和“动作描述”。这样等会写提示词时,就能直接对着表格逐行抄,而不是重新想。
简单说,分镜脚本不只是一个“创意草稿”,它应该是整个项目的作业指导书。前期花 30 分钟把它写清楚,后期至少省下三小时返工时间。
3. 人物设计:防“跑脸”是 AI 动画制作里最关键的一场仗
3.1 从豆包生成角色设定卡开始
做 AI 动画短剧,角色不统一是最常见的问题。第一幕是黑发女主,第二幕变成了棕发,第三幕连五官都不一样了。这个问题的根源在于:你只用了一句“漂亮女孩”去描述角色,AI 每一次都在自由发挥。
解决思路是反过来,先写一份极其详细的角色设定卡,把 AI 自由发挥的空间压缩到最小。我还是用豆包来生成这份设定卡,直接给它一段指令:
请为我的AI短剧设计主角“林晓”的视觉设定卡,要求包含: 外貌:脸型、眼睛、发型、发色、身高 服装:整套配色、单品细节、配饰 标志性道具:必须随身出现的东西 色彩方案:这个人身上出现最多的3种颜色 画风描述:二维动画质感、赛博都市冷色调 避免模糊词,例如“帅”“美”,全部改为具体描述豆包会给你一份相对完整的设定卡。比如林晓可以是:瓜子脸,银色齐肩短发,蓝色风衣,浅灰高领内搭,圆框眼镜,左耳有一个“十字星”耳钉,主色是银、蓝、深灰。
这段描述会反复出现在你后续所有提示词里,它就像一个记忆锚点。
3.2 用即梦生成定妆图,最好有正面、侧面、表情三张
角色设定卡拿到后,下一个动作不是急着做镜头,而是先“定妆”。在即梦里生成三张图:正面站姿、侧面转头、一个明显情绪表情,比如微笑或惊讶。
这步关注的不是画得多好看,而是稳定。我们想要的是“以后每次提到林晓,都用这套特征去复现”的底图。因此,我会用同一段提示词生成 4 到 8 张候选图,选出一张脸型五官最稳定、细节最顺眼的,把它作为后续所有图生视频、垫图参考的基准底图。
3.3 防“跑脸”的三个实操方法
第一个方法是垫图/参考图。即梦的图片生成或者图生视频功能里,通常都支持上传参考图。这个功能的作用是告诉 AI:“主角长这样,你照着画”。每次生成新镜头时,我都会把定妆图拖进去,效果比纯提示词稳定非常多。
第二个方法是提示词里强制重复设定信息。哪怕用了垫图,我还是会在每个镜头提示词里把角色设定卡的核心信息再写一遍:“银色齐肩短发、蓝色风衣、圆框眼镜、冷色调”。原因很简单,垫图负责整体气质,文字负责细节约束,两者叠加,角色漂移的概率才会降到最低。
第三个方法是控制画面内要素的数量。AI 在复杂画面里很容易把两个人物搞混。如果一场对话戏里有两个角色,我会先分别生成两个人各自的特写镜头,再生成一个双人同框的远景镜头。在双人同框镜头里,把两个人的特征同时写进提示词,哪怕稍微复杂一点,也要写清楚“左边的人是谁、右边的人是谁、分别穿什么”。
3.4 用“画面锚点”来降低返工成本
还有一个很多人不知道的技巧,我叫它“画面锚点”:在生成第一幕镜头时,不只记录这张图的 prompt,还额外记录它的关键设定词,比如“蓝灰色调、赛博城市夜景、细雨、霓虹灯倒影”。往后的镜头,无论场景怎么换,这些氛围词要尽量保留。这样整条片子看下来,画面风格才是一致的,不会像拼贴画。
角色设计这一关,我要多说一句:宁可多花一个晚上做定妆,也不要急着生成所有镜头。我见过太多人第一天就猛出一堆图,结果做到第三天发现角色全不一样,全部推翻重来。别问我是怎么知道的。
4. 镜头语言:AI 短剧能不能火,分镜阶段就已经决定了大半
4.1 把“镜头”写清楚,AI 才能听你的话
镜头语言不是玄学,它就是在告诉看的人:“此刻你应该看哪里,感觉到什么。”你如果不写清楚,AI 就会给你一个平视的中景,画面里的人像木头一样站在正中间,整条片子自然没有电影感。
在给即梦的每一段提示词里,我要求自己至少包含这几个镜头要素:
- 景别:特写、近景、中景、全景、远景
- 机位/角度:平视、俯视、仰视、低角度
- 运动方式:固定、推进、拉远、跟随、环绕
- 情绪氛围:压抑、明亮、紧张、安静
拿第 2 章的分镜表举个例子。S01 是全景,那提示词里就写“深夜办公室全景,顶视角往下压,压迫感强”;S02 是特写,就写“人物眼睛特写,瞳孔收缩,镜头缓慢推进,能看清睫毛和镜片反光”。这样生成出来的画面,即使构图不完全符合预期,方向也不会偏太多。
4.2 短视频的镜头法则:特写优先,运动克制
通过实际播放数据,我会说一句可能被专业导演嫌弃的话:在短视频平台,特写永远比全景吃香,带情绪的脸永远比大场景留住人。
因此我做 AI 短剧时,分镜比例通常是特写 40%、中景 30%、全景 20%、远景 10%。全景用来交代环境,不能停留超过三秒;特写用来抓情绪,是卡点和配乐的重点。
运动方面,尽量保持单一方向运动。不要一个镜头里既推近又环绕再拉远,AI 视频生成模型在复杂运动下很容易变形、闪烁。最稳的组合是:固定机位 + 人物小幅动作,或缓慢推进 + 人物静止。宁可保守,也不要让角色胳膊突然多一根。
4.3 用“镜头拆分表”把一段戏翻译成画面
我把第 2 章那段 20 秒的“深夜办公室”戏,再拆给你看一遍,但这次标注了更细的画面运动方向:
| 镜头 | 景别 | 镜头运动 | 画面内容 | 情绪 |
|---|---|---|---|---|
| S01 | 全景 | 缓慢推进 | 她独自坐在办公室,窗外霓虹闪烁 | 压抑 |
| S02 | 特写 | 固定 | 瞳孔放大,手指悬在键盘上 | 警觉 |
| S03 | 中景 | 缓慢横移 | 她转头看向门口 | 紧张 |
| S04 | 全景 | 固定 | 门口站着同样的角色 | 惊悚 |
| S05 | 特写 | 疾推(后期处理) | 椅子摩擦声后她后退 | 恐慌 |
| S06 | 中景 | 轻微晃动 | 人影迈步向前 | 加剧 |
| S07 | 特写 | 固定 | 她摘掉眼镜,微笑 | 反转 |
做完这个表,你会发现,即梦的每个镜头需要生成的视频,其实就是一个 2 到 4 秒的短片段。S01 可以说只是“一个静谧的环境镜头,镜头慢慢推近”;S02 则是一个“她瞳孔放大的面部特写,几乎没有动作”。
语言越简单,AI 越容易渲染稳定。
4.4 转场是救急的,不是炫技的
关于转场,我的态度比较务实:AI 短剧因为生成的是片段拼贴,镜头之间天然会有跳跃感,适当使用转场可以掩盖这种不自然。但转场绝不能多,每条片子里 2 到 3 个醒目的转场就够了,其余用硬切反而更像真实电影。
我最常用的是“加速推进转场”:在上一镜头末尾,用剪映把画面快速放大到 120%,下一镜头从特写直接切入,观众会产生一种“唰”一下被拽进下一场戏的感觉,这比花哨的模糊转场干净得多。
5. 即梦实操:从一张定妆图到每一段动态画面的完整走查
5.1 把分镜表翻译成即梦提示词的公式
到了这一步,终于要打开即梦开始干活了。但注意,我们不是直接把分镜表里的“画面内容”复制进即梦,而是要先翻译成一套生成提示词。我用的公式是这样的:
画面主体 + 环境背景 + 景别机位 + 镜头运动 + 角色锁定 + 氛围光色 + 质量词拿 S02 镜头来举例。分镜表里写的是“她听到门外声音,瞳孔忽然放大”,翻译成即梦提示词后是这样:
画面主体:银色短发女性,圆框眼镜,蓝色风衣,表情惊讶,瞳孔放大 环境背景:深夜办公室,暗光,窗外霓虹灯 景别机位:面部特写,平视,固定机位 镜头运动:轻微呼吸感,几乎不动 角色锁定:与参考图一致 氛围光色:冷蓝色调,侧光打在脸上 质量词:细节丰富,电影感,8k质感你看到区别了吗?我不再写抽象的“她”,而是把所有视觉信息全部显式化。即梦不读心,它只读到词。
5.2 先出图,别急着上视频
在即梦里,我的顺序永远是先“文生图”,再“图生视频”,而不是直接“文生视频”。因为文生视频在首帧上不可控,角色形象和构图容易跑偏,而图生视频可以锁定你满意的那张画面。
具体操作是:生成 4 到 8 张图中选出结构、情绪、脸部都最好的那张,放大、保存。然后用这张图作为图生视频的输入图。
这里有一个小习惯:生成图时如果有几十分接近的图,不要急着选最精致的,而是选构图最“正”的。画面里人物居中、比例正常、没有畸形部位,这种图生成视频时更稳定。过度精致的细节点进视频之后往往会因为动态而糊掉。
5.3 图生视频:动作描述要短,幅度要小
图生视频的动作描述和提示词不一样,不需要堆砌很多形容词,只需要清晰的动作短句。比如:
她缓慢转过头,眼睛看向门口方向,肩膀微微缩紧这种“缓慢”“微微”之类的幅度词,对稳定性很有帮助。我不会写“她猛地站起来打翻桌上的水杯”,这种剧烈动作十次有八次会生成出诡异效果。如果你想表现这种张力,建议拆成两个镜头:先给一个手部特写,拿起杯子;再给一个中景,她站起转身。用剪辑去制造爆发力,而不是让 AI 一镜到底。
5.4 即梦实操中的几个典型翻车现场
我把自己实际遇到过的翻车情况整理成一个表,方便以后对着排查。
| 问题 | 原因 | 处理方式 |
|---|---|---|
| 脸部崩坏 | 动作幅度大、角度刁钻 | 改用小幅度动作,或用面部特写重新出图再生成视频 |
| 手部畸形 | 手部特写时手指数量出错 | 尽量避免手部特写;拍不到脸部那就用特写肩部轮廓 |
| 角色换衣服 | 提示词中服装细节丢失 | 把角色设定卡的服装关键词固定复制进每一段提示词 |
| 画面抖动闪烁 | 运动路径复杂 | 缩短生成片段时长,剪映中做去闪或加轻晃动修饰 |
| 文字乱码 | 画面中带字 | 不在画面里生成文字,标题字幕一律后期用剪映加 |
还有一个经验是:如果一段视频跑了三遍还是不满意,及时止损。不要跟 AI 死磕某一个镜头。强行耗时间会消磨你的耐心,我一般会换一个角度来表达同样的信息,比如原本是脸部特写的,改成从背后拍,再补一个环境音效。
5.5 素材入库,文件名即命运
所有从即梦下载下来的视频或图片,我都会立即重命名,格式为“镜头编号_内容_第几次尝试”。例如:
S03_转头看门口_取景2.mp4 S01_深夜办公室全景_t1.png这个习惯能在剪映阶段省掉至少 30% 的挑选时间。刚开始你觉得下载完就在上传文件夹里,找起来很方便,等做到第 20 个镜头时就会感谢自己当初的命名规范。
6. 剪映:把一堆片段变成“成片”的最后冲刺赛道
6.1 先把分镜素材全部拖入时间轴,按镜头编号排列
打开剪映,新建项目,把你生成好的视频按 S01、S02、S03 的顺序依次拖入轨道。此时什么都不要想,不要急着加滤镜、加转场,先把所有镜头按顺序铺好。
这一步看起来简单,其实很关键。它是在做一个“粗剪”,目的是让叙事线先成立。铺完之后快速播放一遍,检查故事是否能看懂。如果某个镜头缺失,赶紧回即梦去补,而不是在剪映里硬用别的素材填空。
6.2 配音与音效的优先级排序
我会在确认画面叙事通畅之后再处理声音,因为声音是帮助观众理解画面的重要线索,也是让 AI 画面看起来更高级的关键。
剪映的文本朗读功能有很多配音员可以选择,我会根据片子风格选择不同的声音。悬疑片,选择一个低沉、语速略慢的男声;治愈系,选择一个轻柔的女声。设置完音色后,我通常会把语速调到 0.9 倍或者 1.1 倍之间,以匹配画面节奏。
配音的排布不需要每一秒都说话。安静的画面里只留环境音效,效果往往更好。比如 S02 里她听到声音愣住,这一下我故意把配音停住,只保留一声玻璃的脆响,紧张感一下就出来了。
音效可以从剪映音效库找,搜索关键词“高跟鞋”“玻璃响”“心跳”“电流”等,很多现成的素材可以直接用。音效的位置尽可能精确到画面上某个动作发生的瞬间,也就是说,画面里她脚刚刚动的那一帧,音效就要同步响,这样观众才不会觉得“声音慢了半拍”。
6.3 字幕的新建与统一
AI 短剧如果没有字幕,完播率至少掉一半,因为很多人习惯静音刷视频。剪映的“智能字幕”功能很省事,语音识别之后能自动生成字幕,但 AI 识别时人名或专业名词经常出错,比如“林晓”可能被识别成“林小”,所以识别之后一定要回头校对一遍。
我会在字幕样式里先设定好一个模板,比如白色字体、黑色描边、字号合适,然后应用到全部字幕。确保同一条片子里字幕位置统一,不要出现一个字幕在顶部、下一个在底部的情况。
6.4 成片前的三道自检关卡
第一条自检是“脸”:从第一帧到最后一帧快速过一遍,重点看主角的脸、发型、服装是否连续。如果某一帧里发型突然变短,我宁可删掉这一段换别的镜头,也不能让它留在成片里。
第二条自检是“音”:关闭画面只看音频时间轴,看配音、音效、音乐有没有爆音或突然中断,人声是否清晰。
第三条自检是“节奏”:全片连续播放两遍,第一遍不用刻意分析,就凭直觉感受有没有明显的无聊段落;第二遍再看,如果一个镜头超过 4 秒还没有任何运动或变化,那大概率要切短。
这三道检查都做完之后,再导出成片。字幕的加粗、封面、标题这些导出后再处理,也不迟。
7. 3天变现路线:从第一支练习作品到第一次接单报价
7.1 第一天的目标:不是做出爆款,而是跑通闭环
很多人把“3天变现”理解为第一天就开始接单,这不太现实。我的建议是,第一天只做一件事:按照前六章的流程,用两天分别制作一个 30 秒以内的完整短片。不要贪多,不要一个晚上切换三个题材,选定一个题材,从分镜到成片完整走完一条线。
第一支作品大概率会粗糙,这没关系。它的意义在于让你把整个链路中所有可能出现的问题都暴露出来,你知道脸会跑偏,你知道运动幅度太大会崩,你知道剪映里的字幕会被识别成错别字,这些经验看多少教程都学不会,只有亲手做一遍才能内化。
7.2 第二天:做出三支不同风格的小样片
流程熟练以后,第二天就不要再做同一种东西了。如果第一支做的是悬疑片,第二支可以做治愈系,第三支可以做赛博科幻。这不是在浪费精力,而是在准备你的作品集。
接单的时候,客户的需求是多种多样的。一个客户问“你能不能做古风”,你说“我没做过,但我可以做”,和你说“给你看看我之前做过的样片”,完全是两种信任度。所以第二天就用最小成本把三种常见风格各做一条 15 秒样片,你之后谈单的时候才能拿出有说服力的东西。
7.3 第三天:整理作品集和报价单
作品集不用很复杂,把三支样片截取封面图,配上标题和一句话介绍就够了。然后是报价单,我建议按“单镜头报价”方式做,先给客户一个区间,再根据修改次数浮动。
下面是一个简化版报价参考:
| 项目类型 | 规格 | 参考报价区间 |
|---|---|---|
| 竖屏AI短剧,30秒内 | 15-20个镜头,含配音字幕 | 800-2000元 |
| 企业宣传AI动画 | 45秒-1分钟,定制角色 | 2000-5000元 |
| AI漫画解说 | 3分钟,图文成片 | 500-1500元 |
| 单张AI海报/封面 | 1张 | 50-200元 |
这个报价只是参考,不是标准答案。不同城市、不同客户预算差异很大,关键是你要建立一个锚点:按时长和镜头数来计费,而不是按“我觉得做这个花了多少小时”。
7.4 接单的第一步是什么
接单渠道我建议从两个维度同时铺:一个是身边的资源,把作品集发给认识的自媒体运营者、电商老板、装修公司,这些人都需要日常短视频素材;另一个是线上接单平台,比如兼职类的社区、设计外包平台,搜“AI绘图”“AI视频”等关键词。
第一次谈单时,一定要在交付标准里写清楚三件事:修改次数(比如最多两次)、交付物格式(MP4、MP3、字幕文件等)、授权范围(是仅用于这一个账号,还是可以多次使用)。
还有一个细节:不要接内容本身有版权风险的单子,比如用某部热门动漫的角色形象做商用视频。AI 生成的内容再好看,一旦涉及侵权,最后承担责任的还是执行者自己。接单之前先问清楚用途,这是保护自己最重要的一步。
7.5 变现的真实预期管理
最后说点实在话。这套流程做熟之后,完成一条 30 秒短剧的效率大概在两到三个小时,其中一大部分时间花在 AI 生成等待和素材筛选上。如果你的成品质量不错、作品集投放准确,一个月接到几个单并不是天方夜谭。但它不会让你一夜暴富,本质上是一个技能变现过程。
我个人做这套流程最大的收获,反而不是那几单收入,而是掌握了一套“把想象快速变成画面”的能力。客户说“我想要一个未来世界的故事”,我不会发懵,而是会打开豆包写分镜,打开即梦出图,剪映配音剪辑,两个小时后就能给对方一个可以讨论的画面雏形。这种确定感,才是这个工具组合真正值钱的地方。
文档里需要完整的分镜模板、角色设定卡和报价单,你在正文里已经看到表格结构了,直接复制到表格软件里就能用。之后每次做新项目,先打开文档模板,改掉角色描述和剧情,省下从零开始想结构的时间。