做 AI 漫剧、AI 短剧的团队,绕不过两个老大难:一个是画风飘、人物走形、场景穿帮,看着看着观众就出戏;另一个是想稳定日更、批量出片,工具链拼得乱七八糟,产能上不去。
这两块的底层链路,国产项目 DramaClaw 直接一起开源了,采用 Elastic License 2.0,个人和团队都能拉下来本地部署、二次开发,红线主要在"不能打包成 SaaS 倒卖"。这一点我先说清楚,免得有人拉下代码想直接包一层皮卖服务,最后踩到许可证的雷。
比起放个 demo 级仓库就叫开源,这次真的是从剧本拆解、角色资产、分镜渲染到成片导出整条流水线都能翻,对中小团队来说,这种"能查到底层"的开源,比一堆炫技工具管用多了。
世界模型先兜住穿帮,线稿草图先兜住算力
穿帮这事,本质上是模型没有"世界的记忆"。上一镜女主在客厅左边,下一镜跑到了右边;桌上放的杯子换了个颜色;光源方向莫名其妙翻转——这些不是概率问题,是空间逻辑没建起来。
DramaClaw 的思路是给场景做世界模型,让空间关系稳住,镜头切换、机位转动的时候,人物、道具、光影不容易跑偏。对于长篇连载,这层"稳"是刚需,别看单集不明显,做到二十集三十集就知道差距在哪。
效率这块,它没跟大部队一起卷提示词优化,而是走了另一条路:先出线稿草图给创作者改,构图、角色位置、镜头意图定下来了,再去跑精细渲染。
看着多了一道工序,其实反过来省。做过 AI 视频的都懂,一遍遍抽卡、每次都是全尺寸精渲染,那算力烧的、时间耗的,才是真的痛。线稿这层等于把返工的成本卡在了最便宜的阶段——这是很朴素的工程思路,但很多 AI 产品就是不肯低头做。
双模式工作流:量产和精修不用二选一
日更走流水线模式,标准化流程保底质量,出片速度上得来;某一集想憋个大招、把重点镜头精雕一下,切到无限画布模式。
无限画布这个交互,商用工具里已经不稀奇了,但开源方案里能做到接近主流商用产品的体验,还是要认可一下。更值得注意的是:画布里调完的镜头能同步回批量主线,不是两套割裂的系统。
这个衔接才是关键。很多工具的通病是量产是量产、精修是精修,两条线一分家,团队一边跑流水线一边在另一个工具里打磨,最后合成又是一堆麻烦。能在一套流程里切换,工作方式就顺得多。
再往上一层是导演智能体,接的是灵山编导大模型,可以用自然语言下指令。类似"镜头往后拉一点,情绪压一压"这种话,模型去自动匹配分镜、人物表演和光影调整。
做 AI 视频最耗人的从来不是创意,是脑子里画面明明清楚,手上却在翻文档、调参数、试插件,一天下来创作没做多少,工具操作占了七八成精力。这块能省多少心力,用过的自然会有感觉。
门槛在哪,适合谁上手
得把丑话说前头:这不是开箱即用的傻瓜工具。基于 Docker 部署,显卡要求相对友好(不是必须搞 A100 那种夸张配置),但纯新手第一次上手还是要花点时间。会命令行、能看懂 README、遇到报错愿意 Google 的团队,跑起来问题不大;完全没接触过部署的个人创作者,可能得先拉个懂技术的朋友帮忙。
哪种人适合冲?我的判断是三类:
一是有一定技术底子、想搭自己漫剧工作流的中小团队,能省一大截研发投入;二是想研究 AI 视频底层链路的开发者,整条流水线能看到,是很好的学习标本;三是已经在跑商用工具、但想把某几个环节替换成自主可控版本的成熟团队。
指望它替代 MJ、可灵、即梦那种"打开就能玩"的产品,方向就错了。开源工业化底层和消费级产品,本来就不是一个东西。
说点实在的
愿意把漫剧工业化底层完整开源的项目本来就没几个。大部分开源项目要么停在算法层,要么停在单点工具,从剧本到成片打通一条线的很少见,愿意用相对宽松协议开出来的更少。
这类项目多几个人踩、多几个人回 issue,生态才立得起来。真觉得方向有意思的,拉下来试试比看十篇介绍都值。至于会不会火,就看后面愿不愿意持续迭代、社区能不能滚起来——开源这事,前半场看代码质量,后半场看人。