做AI漫剧这件事,我前后折腾了快两个月才跑通完整流程。最初看别人发出来的漫剧作品,觉得不就是“小说截图+配音+字幕”嘛,可真到自己上手才发现,从选剧本、定角色、生成画面到剪出有节奏的成片,每一步都有不少坑。这次我把从0到1的完整流程全部拆开讲,不整那些虚头巴脑的概念,直接照着操作就能出作品。
这套教程我用的工具就三样:番茄小说找剧本、豆包生成文案和画面、剪映负责剪辑成片。三个工具全部免费,网页版和手机版都有,不需要装什么专业软件,更不需要会画画、会配音、会剪辑技术。只要你认识字、会复制粘贴,跟着一步步操作,第一个作品当天就能发出来。
1. 先搞清楚AI漫剧到底是怎么做出来的
1.1 AI漫剧的制作流程全景拆解
AI漫剧,简单说就是把小说或者故事脚本,变成一集一集的竖屏动画短视频。它介于静态漫画和动态视频之间,画面是AI生成的图片,再配上旁白对白和音效,然后用剪辑软件让画面动起来、字幕跳出来,看起来就像一集短剧。
完整流程拆解下来是六个环节:找故事、写脚本、定角色、出画面、配声音、做剪辑。六个环节里,AI能干的有四个,你需要手工干的主要是两个:选故事的眼光,以及剪辑时的节奏把控。
- 找故事:这步决定你的漫剧能不能留住人。选对了爆点密集的故事,后面全是顺风局。
- 写脚本:把小说章节拆成分镜脚本,明确每一段画面配什么台词、镜头怎么走。
- 定角色:给主角固定长相、服装、发型,保证全剧人物看起来是同一个。
- 出画面:按分镜脚本生成一张张竖屏漫画图。
- 配声音:给旁白和对白配音,这是漫剧观众最先感知到的部分。
- 做剪辑:把图、声音、字幕、转场、背景音乐按节奏拼起来。
很多人看到这个流程就慌了,觉得要学剪辑、要学AI绘画、要学配音,门槛太高。其实完全反了,这些环节里最重的活——生成画面和配音——都被AI包了,你要做的只是告诉它“我要什么”,然后把它给的东西按顺序摆好。
1.2 为什么只需要“番茄+豆包+剪映”这三样
我一开始也想过用更“专业”的方案,比如用Stable Diffusion本地出图、用专业配音软件、用PR剪辑。后来发现对普通人来说完全没必要,甚至本地部署那些工具光是环境配置就能劝退一堆人。番茄、豆包、剪映这三个工具组合起来,是当前门槛最低、效率最高的搭配,没有之一。
先看分工。番茄小说解决“内容源”:漫剧最核心的是故事,番茄有大量有版权授权的免费小说,改漫剧不愁没有素材。豆包解决“内容生产”:它既能根据小说生成分镜脚本,又能按描述生成漫画图,还能用语音合成读出台词,相当于把编剧、画师、配音演员三个角色打包了。剪映解决“内容组装”:把素材拼成视频,自动加字幕、加背景音乐、调节奏,一条龙。
再看为什么不用别的。很多人问为什么不直接用ChatGPT写脚本,因为豆包对中文网文的语感把握更贴近番茄小说的风格,而且一个账号同时搞定文字、图像、语音,不用来回跳平台。还有人问为什么不用Midjourney出图,因为MJ的门槛在提示词、网络环境和订阅费,对新手不友好;剪映则是目前用的人最多的剪辑软件,手机版和电脑版素材云同步,做竖屏短视频就是它的舒适区。
这里有个特别会被忽视的优势:这三个工具都是字节系产品。你用豆包生成的文本和图片、用番茄选的小说,最终都能很自然地拿到剪映里加工,生态内配合度高,素材传输没有阻碍。对新手来说,越顺滑的工具链,越容易坚持下去。
1.3 做AI漫剧之前先想清楚这几件事
开始动手前,先把三个问题定下来,不然做着做着就跑偏了。
第一,定位发在哪个平台。抖音、快手、小红书、B站,各平台的用户口味不一样。抖音和快手偏好节奏快、爽点密、前3秒就要抓住人;小红书更吃画风精美、文案有共鸣的内容;B站则对题材新鲜度和内容深度有一定要求。我建议新人先从抖音做起,因为漫剧和抖音的竖屏生态最匹配,算法对短平快的内容也友好。
第二,一集做多长。1到3分钟是主流,太短讲不清情节,太长观众划走。我自己的体感是90秒左右最舒服,正好能铺垫一个小冲突并留下钩子。
第三,更新频率能不能保证。漫剧是个内容连续更新的赛道,你发了一集,观众等下集;如果断更半个月,前面积累的关注度会掉得很快。所以新手前期不要贪多,一周更新2到3集,稳定比爆发重要。
这三个问题想清楚了,再往下操作就不会迷茫。接下来我从选剧本开始,一步步把每个环节的做法和背后的逻辑都摊开讲。
2. 剧本素材与角色设定的关键细节
2.1 在番茄小说里选适合改编成漫剧的内容
番茄小说里书很多,但不是每本都适合改成漫剧。我建议选书时盯住三个指标:节奏快、冲突强、对话多。
节奏快的书,基本每一章都有事件推进或反转;节奏慢的书大段环境描写和心理活动,改成画面就是灾难——AI生成一堆风景图,没有人物互动,观众看不下去。冲突强的书,比如逆袭、打脸、复仇、穿书、系统流,这些天然适合短视频的强情绪逻辑,观众爱看。对话多的书改编成本低,两个角色对几句台词就能撑起一个镜头,画面简单但信息量足够。
具体怎么找?打开番茄小说首页,重点看“热门榜”和“分类榜”。热门榜是被市场验证过的题材,流量逻辑没错。进入一本书后先别急着读正文,看目录和评论区。目录里如果第5章、第10章就有明显的事件爆发点,这本就适合改编;评论区如果有人说“这里太爽了”“细思极恐”,说明它的内容情绪共鸣强,改编成视频大概率也能带情绪。
选好章节后还有个避坑点:不要直接大段复制原文。我的做法是复制小说章节内容发给豆包,让它“提取核心情节”,而不是原封不动搬台词。一来规避版权风险,二来小说文字和口语表达有区别,改编后的台词要适合“听”。
2.2 用豆包把小说变成分镜脚本的实操方法
拿到小说章节后,不是直接去生成图片,而是先整理成“分镜脚本”。分镜脚本就是每一幅画面拍什么、配什么台词、字幕写什么,它在整个AI漫剧流程里相当于施工图纸,没有图纸就硬施工,画面一定乱。
我自己用豆包整理分镜的提示词是这么写的:
请把以下小说内容改写成AI漫剧分镜脚本。要求: 1. 每段只表现一个场景动作,不要在一个镜头里塞多个事件。 2. 输出格式为:序号、景别(近景/中景/远景/特写)、画面描述、台词、字幕文本。 3. 画面描述要写清楚人物在做什么、表情状态、场景环境,方便之后用AI生成漫画图片。 4. 台词要口语化,每句不超过30个字,适合配音朗读。 5. 一集控制在8到12个分镜之间。把小说内容粘贴进去,豆包输出的结果基本就能直接用。如果觉得某一镜的景别或者台词不满意,直接跟它说“第3镜改成特写,台词再简短一点”,改完再复制出来。
这里有一个我踩过很多次的坑:豆包第一次输出的分镜往往偏多,动不动就给你列20个镜头。别嫌多,这只是初稿。你自己要根据叙事节奏砍到8到12个,砍掉的是那种“过渡性、无冲突”的镜头,保留的核心永远是“人物冲突+情绪转变”。剪辑时你会感谢自己当初多花了10分钟删镜头。
2.3 人物一致性是漫剧成败的关键,怎么用豆包保证
AI漫剧最让人头疼的问题不是画得不好看,而是人物长得不像同一个人。第一集男主是黑发,第二集变棕发;第一集女主穿红裙子,第二集变白裙子——观众一眼就出戏,觉得这是两部作品拼在一起。这问题不解决,作品很难起来。
我现在的做法是,在动手生成所有画面之前,先做“角色设定卡”。用豆包生成一个高度细节化的角色描述,定死主要人物的外貌和服装,之后每一次生成图片,都把这个角色描述原封不动带进提示词里。
举个例子,我给女主定的是:
22岁东方女孩,黑色长发扎成高马尾,发尾微卷,杏眼,左眼下有一颗泪痣,穿白色衬衫搭配黑色背带裤,表情倔强,整体漫画风格,明亮的柔光。这段描述会反复出现在每一张含女主的图片提示词里。生成时如果豆包每次画出来差异还是大,我还会在描述里加上“泪痣”“高马尾”这种辨识度高的五官特征,比单纯说“长得很漂亮”管用一百倍。AI对具象特征的记忆力比抽象形容词强得多。
万一人物还是不稳定,还有一个兜底办法:把已经生成好且满意的正脸图作为参考图,在下一次生成时上传,告诉豆包“新图的角色要和参考图里的人物保持一致”。这种“图生图”的方式能极大缓解换脸问题。当然,不用追求百分之百一致,漫剧观众对轻微变化有一定容忍度,关键是服装、发型、肤色这些大特征不能跳脱。
3. 画面生成与配音配乐的完整流程
3.1 用豆包生成漫剧画面的提示词写法
分镜脚本有了,角色设定卡有了,下一步就是把每一镜变成图片。这一步决定你的漫剧是“高级感”还是“廉价感”,核心全在提示词怎么写。
我给豆包写画面提示词的固定公式是:主体 + 动作 + 场景 + 画风 + 光线构图 + 画幅比例。六要素带齐,出来的图基本不会跑偏。
举个例子,分镜脚本第一镜是“男主推开咖啡厅门,眼神冷酷,女主抬头看见他,愣住”,我写的提示词是:
青年男子推开咖啡厅玻璃门,穿着黑色机车皮衣,短发,眼神冷酷;咖啡厅内,桌前坐着的白色衬衫长发女孩抬起头,表情惊讶。现代都市漫画风格,细腻线条,明亮柔和光线,中景构图,竖屏9:16。看到没有,人物有具体服装和表情,场景有具体场所,情绪有“冷酷”“惊讶”,构图和比例也给定了。我给新手一个建议:与其追求花哨的形容词,不如把描述写具体。AI对“好看”“唯美”这类词的理解很抽象,但你对“黑皮衣”“玻璃门”“抬头”这些具象词的控制力强得多。
另外提示词里一定要带“竖屏9:16”,否则豆包默认出的图可能是方形,放进竖屏视频要么裁切要么糊。如果一次生成四张里有一张特别满意,马上用这张图作为后续画面的参考基准;如果四张都不满意,别死磕,微调提示词重新生成,通常把人物的某个特征提得更具体就有改善。
3.2 配音与音效的落地方法
漫剧的声音包括旁白、角色对白和背景音乐三部分。旁白负责推进剧情,对白负责表现人物性格,BGM负责推情绪。很多新手只做前两样,忽略BGM,结果视频干巴巴的,观众情绪完全起不来。
豆包的语音合成功能可以直接解决旁白和对白。把分镜里的台词准备好,在豆包里选一个合适的音色,生成配音,再下载成音频文件。我建议旁白用一个成熟稳重的音色,男女主对白根据人物性格选:女主声音偏清亮、男主偏低沉。同一角色的对白,全剧尽量固定同一个音色,这和人物视觉一致性是同一个道理。
配音生成之后要听一遍,重点检查两点:一是听重音和停顿是否自然,二是听有没有明显的机械感。机械感重的句子,在豆包里加语气词或者把文字改得更口语化再重生成,比如“她没想到会在这里遇见他”改成“她做梦都没想到,居然会在这里碰见他”,读出来情绪立刻就对了。
背景音乐我用的是剪映自带曲库,搜索“悬疑”“热血”“抒情”“搞笑”等关键词,总能找到适合片段的BGM。BGM音量控制在能听到但又不压过人声的水平,我通常把BGM调到人声音量的30%左右。片头可以掐一首歌的高潮部分,片尾用淡出结尾。
3.3 素材整理与命名规范,剪片时能少掉一半头发
我先说结论:把所有素材按分镜编号命名,这件事在你剪片的时候能省下大把时间,是很多人忽视的隐形效率点。
生成好图片、下载好配音之后,别急着开剪。先在电脑或者手机里建一个项目文件夹,按“集数-镜头序号”规则整理。比如第2集第3镜的人物图就叫“E02-03A”,备选图叫“E02-03B”,对应配音文件叫“E02-03V”。文件夹结构类似这样:
AI漫剧项目/ ├── 01集/ │ ├── 分镜脚本.md │ ├── 图片/ │ │ ├── E01-01A.png │ │ ├── E01-01B.png │ │ └── E01-02A.png │ ├── 配音/ │ │ ├── E01-01V.mp3 │ │ └── E01-02V.mp3 │ └── 成片/为什么要这么较真?因为漫剧一集八九个分镜,素材加起来几十个文件。你如果不按编号命名,剪映里全是一堆“图像1234”“音频5678”,等拖进轨道找对应关系时,眼神差一点的人直接崩溃。我第一次做的时候偷懒没编号,结果在图和声音之间来回对,剪一集花了三小时,第二次老老实实编号,一集连剪带优化只花四十分钟。
4. 剪映成片:从粗剪到发布的保姆级操作
4.1 导入素材与粗剪的基本步骤
剪映的电脑版和手机版功能差不多,我建议用电脑版,屏幕大,轨道看得清楚。打开剪映,新建草稿,先把素材全部导入。导入后第一件事不是摆图,而是先把配音文件按顺序放入音频轨道,相当于先搭好声音骨架,再往骨架上贴画面。
操作顺序是这样的:
- 把配音文件从素材面板拖到音频轨道,按分镜顺序排好。
- 点选音频文件,复制它的大致时长。
- 把对应分镜的图片拖到视频轨道,时长拉到和音频一致或略长一点。
- 重复这个动作,直到所有配音和图片都对应上。
这个过程就是粗剪,目标是“声音不断、画面不黑屏、顺序不错”。不用管转场、字幕、特效,先把流水账拼出来,再进入精修阶段。
粗剪完成后从头到尾播放一遍,这一步别跳。重点检查有没有某一镜画面和台词对不上,比如台词已经说到第二句了画面还是上一张图,说明这个镜头的图片时长太短,拉长一点;反过来如果台词说完了画面还停着,就把图片缩到音频结束的位置。
4.2 字幕、转场、音效与画面动感处理
粗剪完成后,漫剧从“草稿”变成“作品”,靠的就是精修这四件事。
字幕是漫剧的生命线。看漫剧的人很大一部分是通勤路上、吃饭时静音刷手机,字幕不清晰直接损失一大半观众。剪映的“自动识别字幕”功能能直接根据配音生成字幕,识别率很高。生成后把字幕样式改成粗体、带黑色描边或半透明底,确保任何背景下都看得清。字幕字体我建议用“默认”或者“思源黑体”,太花哨的字体在手机上反而显得LOW。
转场不要太花哨。很多新手喜欢在每张图之间加翻页、百叶窗、花瓣飘落之类的特效,结果整个视频像PPT演示大赛。漫剧最自然的转场是“叠化”和“硬切”,叠化用于时间过渡、情绪缓和的地方,硬切用于对话切换和节奏加快的地方,时长都控制在0.2到0.5秒。如果你不知道怎么选,全部用叠化,不会出错。
音效是提升质感最容易忽略的一环。剪映音效库里可以搜“开门声”“脚步”“心跳”“风声”“铃声”等,在对应画面位置加上。比如人物推门的镜头配一声门响,手机亮起的镜头配一声消息提示音。音效不用多,每个镜头最多加一个,多了反而乱。
静态图片要“动”起来,靠的是关键帧缩放。剪映里可以给图片设置动态效果,比如画面从“放大”慢慢“缩小”,或者从“特写”缓缓“拉远”。操作是选中图片,在开始位置打一个缩放关键帧设成100%,在结束位置再打一个关键帧设成110%,图片就会自动产生缓慢推进的镜头感。这个细节做完,漫剧的观感会一下子从“PPT”变成“视频”。
4.3 导出参数与多平台发布建议
导出视频时的参数很多人不注意,直接默认导出,结果发到抖音后画质糊成一片。剪映导出时,我建议手动确认这几个参数:分辨率1080P,帧率30帧,码率用“推荐”或“更高”。尽量不要用低于1080P的分辨率,否则手机上看脸都是糊的。
导出名可以直接写成“项目名_集数_成片”,方便以后整理复盘。
发布到抖音时,封面、标题和话题标签也要花心思。封面我会选择视频中最有情绪冲突或画面最好看的一帧,用剪映导出一张封面图,然后配上一个能勾起好奇心的标题,比如“她不知道,这一次见面是最后一面”“重生后,我决定不再善良”。这类走向明确的标题适合漫剧的强情绪内容。话题标签用“#AI漫剧 #漫画推荐 #小说推文 #AI视频”,让系统更快识别你的内容类型。
发布时机上,我觉得晚上8点到10点流量相对好,但更重要的是更新稳定。你连续发一周,系统会渐渐给你的账号打上“漫剧”标签,推荐人群会更精准,播放量自然起来。
5. 常见问题与排查技巧实录
5.1 画面人物不一致怎么办
这是我被问最多的问题,没有之一。人物的五官、发型、服装在不同镜头里对不上,确实是AI漫剧新手最大的痛点。
解决办法分三层。第一层是把角色设定卡写得足够具体,并每次生成都完整复制,不偷懒。第二层是参照已经满意的图片进行新的生成,让豆包基于参考图保持一致。第三层是不追求演员完全统一,而是让服装和发型这些视觉标识保持统一,观众对服装发型的敏感度远高于五官细节,只要这两点稳定,漫剧看起来就是连贯的。
如果你发现某一张图的脸特别满意,但服装不对,还有一个笨办法:把这张图作为参考,同时修改服装描述单独生成一张。不需要每个镜头都完美,但主角的重要镜头一定要把好关。
5.2 配音和画面不同步怎么解决
声音和画面对不上,多半是粗剪时图片时长设置的问题。台词多、内容密的镜头,图片需要多停一秒;台词少、动作单一的镜头,稍微一停就觉得拖沓。
我建议先把音频完整听一遍,心里有数“哪个时间点该换画面”,再去调图片时长。剪映的音频轨道上会显示波形,台词密集的地方波形密,空白的地方波形疏,按波形位置卡画面比凭感觉靠谱。
还有一个容易忽略的问题:字数和时长不匹配。中文正常语速大约是每分钟240到260字,一条15秒的配音大概能容纳60到65个字。你脚本里如果一句话写得过长,语音播报可能赶不及,这时把台词的书面语删掉改成口语短句即可。
5.3 画面模糊和字被裁切的问题
画面模糊通常是生成分辨率不够。豆包生成图片后在下载界面选最高清晰度,不要用缩略图,然后导出的视频分辨率保持1080P,码率不要选“更低”,模糊问题基本可以解决。
字幕被裁切多见于竖屏视频。因为某些平台的播放界面底部会有弹幕、评论框、点赞按钮,会遮住视频下半部分。剪映导出前,我建议把字幕和关键信息放在画面上方三分之二的区域内,不要把内容压到最底部。具体操作时可以拉一条安全参考线,把文字控制在安全区以内再导出。
5.4 漫剧新手常见问题速查表
| 问题 | 可能原因 | 解决办法 |
|---|---|---|
| 画面人物不像同一人 | 提示词没有统一角色特征 | 固定角色设定卡,强调发型、服装、泪痣等特征 |
| 图片是方的,不是竖屏 | 提示词漏了画幅比例 | 每次提示词末尾都加上“竖屏9:16” |
| 配音听着像机器念稿 | 文字太书面化 | 改成口语化表达,添加语气词 |
| 字幕和嘴型/声音对不上 | 自动识别字幕有错别字 | 手动校对字幕,重点改人名和专有名词 |
| 静态图没有视频感 | 没有添加缩放或运镜效果 | 用关键帧做缓慢推拉 |
| 视频声音一大一小不均匀 | 配音音量没有统一处理 | 把多段配音选中后统一调整音量,人声保持在-6dB左右 |
| 发布了没流量 | 内容节奏慢或封面标题不吃香 | 前3秒给冲突,标题制造悬念,封面选最刺激的一帧 |
这张表基本覆盖了新手期的全部翻车现场,遇到问题先对照看,不用自己瞎琢磨。
最后分享一个我自己的小习惯
现在每做完一集漫剧,我都会把豆包生成的分镜脚本、角色设定卡、提示词模板、配音文案归档保存。素材多了之后,下一集做起来直接调用以前的角色设定和提示词模板,改改剧情就能开干,效率高很多。我认识的一些做AI漫剧的朋友,基本上都是用这套方法跑通了流程——第一周手忙脚乱,第二周有了自己的模板,第三周就能稳定更新了。AI漫剧这个赛道现在还在上升期,工具门槛已经降到最低了,剩下的拼的就是你能不能坚持把每一条视频发出去,以及有没有用心去观察观众喜欢看什么。第一批作品做得丑一点都不丢人,真正丢人的是始终不开始。