做漫剧这个事,我前前后后折腾了小半年。从最早手动写文案、一张张生成图片,到后来用各种网页工具来回切换,最崩溃的不是某个环节不会做,而是剧本、分镜、画面提示词、配音稿、字幕文件这些产出物全都散落在不同工具里,格式不统一,改一遍要重复粘贴好几次。后来我把 WorkBuddy 这个个人 AI 工作台正式用起来,把整条漫剧制作流水线全部沉淀成技能和自定义指令,才算真正把“免费漫剧制作工具”这件事跑通。这篇就聊聊我是怎么用 WorkBuddy 搭出这套工具链的,里面包括完整思路、配置步骤、提示词协议、参数选择,以及我踩过的坑。
这套方案适合谁?如果你是想做漫剧短视频的内容创作者、靠漫剧搞副业的运营人员,或者单纯想用 AI 批量生产图文故事视频的人,都可以直接参考。不需要会写代码,但需要一点耐心去配置你的 WorkBuddy 工作台。
1. 思路拆解:为什么选 WorkBuddy 而不是堆十个网页工具
1.1 漫剧制作到底卡在哪
漫剧,本质上就是“会动的漫画短剧”:用静态画面加上运镜、配音、音效、字幕,剪成有剧情节奏的短视频。听起来简单,真正上手才发现每个环节都是坎。
第一道坎是剧本。一分钟的漫剧大概需要 300 到 500 字脚本,得有起承转合,得留钩子。第二道坎是分镜,每句台词对应什么画面、什么景别、什么情绪,普通人很难凭空想象出来。第三道坎是画面生成,写画面提示词本身就是门手艺,风格要统一,人物要一致,场景要连贯。第四道坎是配音,得有人声、有情绪,还要跟台词逐句对齐。最后还有字幕,要做成带时间轴的 SRT 文件,才能进剪辑软件。
我之前试过用 ChatGPT 写剧本、用 Midjourney 出图、用剪映配音,每一步都有产出了,但问题是这些产出彼此之间没关联。剧本里写“男主惊讶地看着前方”,到了分镜阶段就得重新描述一遍画面,到了提示词阶段又要再翻译成英文 prompt。同一个信息被反复加工,格式还经常对不上,最后出图的准确率很低。
1.2 WorkBuddy 解决的是“串行协作”问题
WorkBuddy 这类的 AI 工作台工具,核心优势不是它内置的某个模型有多强,而是它把“模型管理、技能扩展、任务编排、对话记忆”集成在了一个环境里。你可以把它理解成一个 AI 版的“集成开发环境”,只不过你开发的不是软件,而是一整套内容生产流水线。
我之所以选它,有几个很现实的原因。
第一,多模型自由切换。同一个工作台里可以接 DeepSeek、通义、智谱这类国内模型的 API,也可以接入本地模型。我日常用 DeepSeek 写剧本,因为中文叙事能力不错且便宜;但某些批量生成任务,我会切到本地小模型去跑,省调用成本。WorkBuddy 相当于一个统一的“遥控器”,不用在几个网页之间来回切换。
第二,技能机制。WorkBuddy 支持安装 skill,也支持自己写自定义技能。这个“技能”可以理解为一段高度结构化的指令模板,让 AI 每次按固定的格式干活。比如我写了一个“漫剧分镜师”技能,不管谁来触发,它都会输出标准化的分镜表字段,绝不会给我自由发挥。这是保证整条流水线稳定性的关键。
第三,本地记忆与历史记录。做漫剧是一个持续项目,人物设定、世界观、画风这些信息如果每次都要重新粘贴,效率太低。WorkBuddy 的会话记忆功能可以把这些背景信息存在本地,下次新开对话依然有效。配合历史记忆迁移功能,换设备也不丢上下文。
1.3 “免费”是怎么实现的
先说实话,完全零成本不太现实,但只要规划好,确实可以做到近乎免费。
我把成本拆成三块。模型调用是大头,所以剧本、分镜这类文本生成任务我优先用 DeepSeek,它经常有免费额度,单价也低。画面生成我走本地 Stable Diffusion 或者免费额度的在线生图,不用 Midjourney 付费版。配音用系统自带语音,或者找免费 TTS 工具生成。WorkBuddy 本身的积分体系偶尔会送额度,做一些轻量任务时我也会消耗积分去跑,具体搭配后面第四节详细说。
免费的关键不是找“不要钱”的工具,而是让每一步产出的格式足够标准化,减少返工。返工烧掉的 API 调用次数,才是隐形的大头。
2. 环境准备:安装、模型接入与技能扩展
2.1 安装 WorkBuddy 与启动慢的坑
WorkBuddy 支持 Windows 和 Linux 两个主流平台,我主力机是 Windows,服务器上跑 Linux 版。安装流程不复杂,直接从官网或者开发者平台下载对应安装包,Windows 用户解压后按提示安装即可,Linux 环境下通过命令行解压执行安装脚本,具体命令以当前官方文档为准。
装完第一次启动可能会比较慢,这一点必须提前说。因为 WorkBuddy 启动时要加载本地模型托管组件、检查技能依赖、建立本地索引,如果电脑配置一般,冷启动等个十几秒很正常。我一开始以为是安装坏了,反复卸载重装,后来才发现是机械硬盘读写慢。解决办法有两个:一是把数据目录放到固态硬盘上,二是关掉开机自启动不需要的模型服务。
Win 系统下还有个细节:如果杀毒软件拦截了本地服务进程,会导致界面显示“网络连接失败”但实际网络是通的。遇到这种情况,把 WorkBuddy 的安装目录加入信任区,再重启应用就正常了。
2.2 接入 DeepSeek 和本地模型
配置模型连接是搭建工具链的核心步骤。打开 WorkBuddy 的模型服务设置,能看到“在线模型”和“本地模型”两部分。
接入 DeepSeek 很简单,去 DeepSeek 开放平台注册账号,创建 API Key,然后在 WorkBuddy 的模型配置里选择 DeepSeek 并填入 Key。这里注意,默认的接口地址和工作台内置的模型名称可能不一致,如果报“模型不存在”或“连接失败”,去模型配置里确认一下模型名称是否填写完整,比如 deepseek-chat 和 deepseek-reasoner 是两个不同模型。
接入本地模型,我建议用 Ollama 做中转。先在本地装好 Ollama,拉取一个中文能力不错的小模型,比如 7B 级别的量化版本,再在 WorkBuddy 里配置本地模型的地址为 http://127.0.0.1:11434。这种“本地小模型兜底”的思路对免费方案很重要,后面会说怎么用。
有一点要强调的是:模型接入不是越多越好。我在工作台里只保留两个在线模型加一个本地模型,太多入口反而会让任务分发变得混乱。你需要做的是把“漫剧制作”专属的默认模型设为中文能力较强的那个,确保技能调用时不会跑到弱模型上。
2.3 安装 skill 和自定义指令
WorkBuddy 的技能体系是最值得花时间的部分。打开左侧技能市场,可以安装社区贡献的技能包,比如前面热词里提到的 superpowers,这类技能包会把通用的结构化输出协议、任务规划方法打包好,装上之后 AI 处理复杂任务时会更“有条理”。
但对于漫剧制作这种垂直场景,更推荐自己写自定义技能。你可以把技能理解成一个“岗位说明书”:告诉 AI 你是什么角色、你要输出什么格式、你遵守什么规则。
我在技能市场安装完基础包之后,自己写了三个技能:漫剧编剧、漫剧分镜师、漫剧提示词工程师。每个技能的核心就是一段严密的提示词协议,配合 WorkBuddy 的自定义指令功能,把输出格式用 JSON 结构或者 Markdown 表格固化下来。这样无论什么时候调用,产出的格式都完全一致。
自定义指令还有一个妙用:把整个漫剧项目的世界观、角色设定、画风描述写进指令里,AI 每次生成都会自动参考这些背景。相当于给你的工作台装了一个项目专属的“长期记忆”。
3. 核心流水线设计:把漫剧拆成 AI 能干的活
3.1 剧本生成的结构化协议
漫剧剧本不能像写小说那样自由,必须按“场次”和“镜头”组织,否则后续的分镜和画面生成根本无法对接。我用的协议是这样的:
你是一名漫剧编剧。请根据故事主题输出剧本,严格按以下结构返回: 【项目名称】 【总时长】 【场次1】 - 场景描述:50字以内 - 出场角色:角色名+情绪状态 - 镜头1:台词 | 说话人 | 动作 | 情绪 | 景别 | 画面内容 - 镜头2:... (全部场次以此类推)规定了“台词、说话人、动作、情绪、景别、画面内容”这六个字段之后,AI 每次写出来的剧本都是可解析的结构化数据。这才是整个流水线能自动跑起来的基础。
这里有个实操细节:一定要在技能描述里注明“每一句台词对应一个镜头”,而不是“每个场景对应一个镜头”。因为漫剧的节奏感来自镜头切换,一句台词配一个画面的密度刚好适合短视频,一屏停留太久观众就划走了。
3.2 分镜脚本与画面提示词的衔接
有了结构化剧本,分镜其实是顺水推舟。我写的“漫剧分镜师”技能做的事情很简单:把剧本里的每个镜头转换成一张分镜表,包含镜头编号、景别、运镜方式、画面主体、氛围光线、文本描述。生成后我会检查分镜数量和台词数量是否一致,数量差通常是 AI 偷懒合并了镜头,需要让它重新生成。
分镜表再往下,就是画面提示词。画面提示词是给生图模型用的,我习惯写成中英混合的格式。中文写清楚主体和动作,英文辅助指定画质和风格。比如分镜里写“男主站在雨夜街角,表情担忧”,画面提示词就生成“A young man standing on a rainy street corner, worried expression, cinematic lighting, anime style, high detail”。
这种衔接方式最大的好处是:剧本、分镜、提示词三份文档共享同一套“语义”,不会出现分镜上写“惊讶的表情”而画面提示词里变成“愤怒”的情况。
3.3 配音稿与字幕文件的一体化生成
配音和字幕在早期被我用成了两条线,后来发现完全可以一起处理。因为两者都依赖同一个东西:台词文本。
漫剧配音最重要的是情绪标注。我在剧本的台词字段里已经带上了情绪状态,配音稿生成时直接把“情绪”和“台词”拼在一起,比如“(担忧地)你真的要走吗?”。TTS 工具看到带括号的情绪提示词,输出的语气会比平白念稿自然很多。
字幕 SRT 文件则需要估算每句台词的持续时间。我经验值是一秒念 3.5 到 4.5 个汉字,算出每句字幕的起止时间后,AI 会直接生成 SRT 格式内容。这个时间轴精度不需要完美,导入剪辑软件后手工微调即可,但能省掉八成手动打字幕的时间。
4. 实操演示:用 WorkBuddy 跑通一部一分钟漫剧
4.1 建立项目指令和技能库
进入实操环节。我先在 WorkBuddy 里新建一个项目,命名为“漫剧-都市奇幻-01”。然后把项目的核心设定写进自定义指令里:主角叫林澈,身份是城市白领,意外获得回溯时间的能力;画风统一为“日系都市奇幻,冷色调,电影感构图”;片长控制在 1 分钟;目标平台是短视频。
同时我把三个技能挂到当前项目上:漫剧编剧、漫剧分镜师、漫剧提示词工程师。这一步做完,WorkBuddy 就从一个通用 AI 工具变成了一个“漫剧专属工作室”。后面所有对话都会自动带上项目设定,不会跑偏。
4.2 一个指令跑通“剧本-分镜-提示词”
配置好项目后,我触发一个整合指令:“请生成一集1分钟漫剧的剧本、分镜表和画面提示词,主题是‘男主第一次使用回溯能力改变一件小事’。”
WorkBuddy 会按照技能顺序执行,先调用编剧技能输出剧本,再调用分镜师技能把剧本转成分镜表,最后让提示词工程师输出每个镜头的生图提示词。整个过程大概是:确认设定、生成、校验格式。
这里有个关键动作:中间结果必须检查。我不会让三条技能一次性自动执行完,而是先让编剧技能跑完,确认剧情没问题,再触发分镜技能。如果剧情不对,后面全白做。WorkBuddy 的对话是连续的,我检查完直接说“按此剧本生成分镜表”,它就能用上一轮的剧本继续。
整套跑下来,产出大致是:一个 8 场戏的剧本,约 20 句台词,对应 20 个镜头,每个镜头附带一份画面提示词。时长刚好 1 分钟出头,符合平台习惯。
4.3 批量生成画面素材
画面素材是漫剧里最花时间也最花成本的一环。我的免费方案是:把提示词工程师给出的画面提示词,批量喂给本地 Stable Diffusion 或者用在线免费额度生成。
本地生图需要一张像样的显卡,如果没有,就用云端免费额度。批量生成时,我会把 WorkBuddy 生成的提示词复制到生图工具的分批任务里,一次跑 20 张。这一步的体验是:如果前面的提示词格式规范,生图环节基本不用改太多;如果提示词写得模糊,20 张图可能废掉大半。
统一画风的方法我放在第五部分细说,这里只提一点:固定种子值。同一个种子加同一组提示词风格前缀,画面一致性会明显提升。
4.4 配音、字幕与剪辑合成
素材齐了之后,配音我用的免费 TTS。把 WorkBuddy 生成的情绪化台词稿逐条复制进 TTS 工具,导出音频。字幕部分直接用 AI 生成的 SRT 文件,再导入剪辑软件。
剪映这类短视频剪辑工具支持图文成片,但自动生成的运镜效果很随机。我更推荐用传统剪辑时间线:每张图对应一个镜头,设置“缩放”和“位移动画”模拟推拉摇移,卡着配音节奏切画面,这样漫剧的“剧感”才出得来。
剪辑环节 WorkBuddy 帮不上太多忙,但它保证了你的素材是齐的、对得上的。我踩过最大的坑就是画面和台词对不上,最后返工。现在我会在出图后把每张图的文件名改成“镜头编号+内容关键词”,例如“04_LinZhe_surprised.png”,导入剪辑软件后一目了然。
5. 参数调优、积分规划与质量提升
5.1 关键模型参数怎么选
很多人用 AI 写剧本,一个模型用到老,完全不知道调参数。其实在 WorkBuddy 的模型设置里,每个接入的模型都可以单独调参数,这对漫剧制作的影响非常大。
我常用的三组参数如下:
| 任务类型 | temperature | top_p | max_tokens | 备注 |
|---|---|---|---|---|
| 剧本创意 | 0.8 - 0.9 | 0.9 | 2000+ | 需要发散,但别太高否则剧情飘 |
| 分镜转换 | 0.2 - 0.3 | 0.7 | 1500 | 严格转换,创造性越低越好 |
| 画面提示词 | 0.4 | 0.8 | 800 | 中英文结合,控制长度 |
剧本生成的 temperature 我试过 1.2,结果 AI 写出了“突然出现外星人”的烂尾剧情,漫剧这种短内容经不起大转折,0.85 左右是我的舒适区。分镜转换必须低温,因为这是格式转换任务,temperature 太高它就会“发挥创意”,把画面东加一句西加一句。
max_tokens 容易被新手忽略。默认值可能只有 500,写剧本到一半就被截断,AI 还会说“由于字数限制,我暂时写到这里”。把剧本任务的长文本上限调高,才不会出现这种尴尬。
5.2 积分与免费额度的省钱策略
WorkBuddy 平台有自己的积分体系,积分可以调用部分内置服务。在线 API 则是按 token 计费。我的省钱策略是四层分流:
第一层,能本地跑的用本地。本地大模型的文案质量虽然比云上模型弱一点,但做分镜表、字幕格式转换这类机械任务绰绰有余。
第二层,创意任务用有免费额度的在线模型。DeepSeek 注册送的额度足够跑几百次剧本生成,我至今还没花过一分钱在文本生成上。
第三层,轻量任务用 WorkBuddy 积分。像“润色一句台词”“检查分镜编号是否连续”这种几分钟的活,没必要动用主力模型,积分顺手就干了。
第四层,批量任务拆成小批次。一次性生成 20 个镜头的提示词,如果中途格式崩了要重跑,浪费巨大。我会拆成 5 个一组,每跑完一组确认无误再跑下一组。
5.3 提升漫剧质量的三个技巧
质量是漫剧能不能火的核心,比省钱重要得多。我总结了三个最有效的方法。
第一个是风格前缀固定法。不管画面内容怎么变,提示词开头统一带“anime style, cinematic lighting, detailed background, character consistency”。这组前缀让你的所有画面看起来像同一个团队画的。如果生成工具支持风格模型,选同一个底模更佳。
第二个是镜头连贯性管理。漫剧最怕人物长相忽变。我现在用的办法是给主角设定“人物描述固定句”,比如“black hair, dark blue eyes, wearing a gray suit”,每一张图都把这句塞进提示词。这样同一人物在不同分镜里的辨识度会高很多。
第三个是配音情绪对齐。免费 TTS 的声音虽然机械,但如果台词稿里每句都带了情绪括号,读出来就会有一点起伏。我还会把“笑”“叹气”“压低声音”这类舞台提示加进台词文本,让 TTS 产生更接近表演的效果。
6. 常见问题与排查技巧实录
6.1 启动慢与“网络连接失败”的正确处理
WorkBuddy 在 Windows 上首次启动慢,容易被误判为死机。判断标准:看 CPU 占用率,如果持续有波动,说明在加载,只是慢;如果稳定为零,说明进程卡死了,需要重启。
“网络连接失败”提示我见过十几次,大部分不是断网,而是本地代理服务没起来。检查顺序是:打开任务管理器,看 WorkBuddy 相关的后台服务是否都在运行;服务在运行但界面报错,就尝试重启数据服务;还不行,检查杀毒软件是否拦截了本地端口监听。我最后就是靠把整个软件目录加进信任区解决的。
6.2 历史对话与本地记忆迁移
换电脑最担心的就是历史对话和项目设定丢了。WorkBuddy 的配置和数据默认存在本地数据目录里,我在旧电脑上把整个数据目录复制到新电脑对应位置,重启后所有项目、技能、历史记录就回来了。这个操作我做过两次,没有出过问题。
如果你之前已经用完一段时间,临时要做迁移,可以在 WorkBuddy 的开发者平台里看看有没有云同步选项,有的话登录账号即可同步。本地手动迁移的好处是保险,云同步失败时可以兜底。
6.3 本地模型接入不上
最常见的原因是模型未下载完整或者地址填错。Ollama 拉取大模型时如果中途断网,拉下来的文件是不完整的,WorkBuddy 就会显示连接超时。解决办法:在 Ollama 里单独跑一次模型确认正常,再回到 WorkBuddy 的模型设置里测试连接。
还有一个小坑:地址必须写全,比如 http://127.0.0.1:11434,不要省略 http。我之前手滑填成 127.0.0.1:11434,WorkBuddy 也能识别,但部分版本会严格校验协议头,直接报“无效地址”。
6.4 积分消耗异常与 API 报错速查表
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 积分消耗特别快 | 循环任务未设置上限 | 检查技能里是否有 while 循环,设置最大轮数 |
| 频繁报 401 | API Key 失效 | 去开放平台重新创建 Key 并替换 |
| 报 429 / rate limit | 请求频率过高 | 调低并发任务数,每批间隔 5 秒以上 |
| 模型返回内容截断 | max_tokens 设置偏小 | 在模型配置里调大输出上限 |
| 响应速度极慢 | 本地模型运行中占用资源 | 把本地模型服务设成按需启动,不用时关闭 |
如果你想省积分,一个关键习惯是:每一轮任务从技能库调用,尽量不要在对话里反复追加碎碎念。每追加一句,上下文变长,token 消耗翻倍。我在跑整条流水线时,会刻意把“生成剧本”和“生成分镜”分成两轮独立对话,减少无关上下文累积。
根据我个人的实际操作体验,用 WorkBuddy 搭漫剧制作工具,最终沉淀下来的不只是几条提示词,而是一套可复用的创作标准。今天把剧本结构、分镜协议、画面提示词前缀、配音情绪标注这些规则固化进技能之后,下一个漫剧组只要换一下设定,就能用同一套管线快速出片。后来我也把成功跑通的整个工作流模板直接复制了一份,取名叫“漫剧工厂”,每次开新项目先加载它,再填新设定,省掉了 80% 的重复试错。