Pixelle-Video新手闯关指南:输入一句话,零门槛免费自动生成专业级AI短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
你手里有灵感,却始终没有一支像样的短视频。不是不想做,而是"写脚本—找素材—剪辑—配音"这条老路,把大多数人挡在了门外。Pixelle-Video是一款开源的AI全自动短视频引擎,它把整条生产线压缩成一步:你只需要输入一个主题,它自己写文案、画配图、配语音、加背景音乐,最后合成成片。这篇指南把上手过程拆成八关,从零开始,一步步带你跑通第一条自动生成的短视频。
第一关:先想清楚,你为什么一直没能把视频做出来
先别急着下载工具,我们来对一下"病情"。你是不是也有过这样的经历:
- 打开剪辑软件,面对密密麻麻的时间轴和轨道,第一反应是关掉
- 想找几张免费又好看的素材图,翻遍图库还是不满意
- 自己念稿配音,要么卡壳,要么声音干瘪得自己都不想听
- 好不容易凑齐素材,画面风格却五花八门,拼起来像大杂烩
这些坎,几乎每个想做短视频的人都踩过。问题的根源不是你不努力,而是传统视频生产链路里,每个环节都要求专业技能。写文案要文字功底,配图要审美和资源,剪辑要软件熟练度,配音要录音设备和状态。四道门槛叠在一起,直接把大多数人劝退。
所以闯关的第一步,不是学剪辑,而是换一条路:把"自己动手做"换成"让AI全自动代工"。这条路,Pixelle-Video已经替你铺好了。
第二关:认识这台引擎——它到底自动了什么
Pixelle-Video的定位,一句话就能说清:AI全自动短视频生成引擎。它把视频制作拆成五道工序,然后自己全部承包:
- AI写文案——根据你的主题,自动生成有结构、有节奏的解说词
- AI画配图——为每一句解说生成对应风格的插图,甚至动态视频
- AI配音——把文案转成自然的人声旁白,支持多种音色
- 自动加BGM——背景音乐一键铺底,省掉配乐环节
- 自动合成——所有素材按分镜拼装,输出可直接发布的成片
整套流程靠模块化设计支撑,各环节就像积木,可以自由替换:文案可以用通义千问、GPT、DeepSeek,也可以接本地Ollama;配图可以走ComfyUI工作流,也可以直连DashScope、Seedream这类API模型;配音支持Edge-TTS、Index-TTS等主流方案。想怎么组合,几乎都能搭。
更关键的是,它把"会不会剪辑"这个问题直接抹掉了——因为根本没有剪辑这个步骤。你把主题给它,它把成片给你,中间的过程被封装成了一句话。
第三关:5分钟跑通第一支视频——从下载到出片的完整走位
理论讲完,直接上手。这一关的目标只有一个:让第一支视频顺利落地,先看到结果,再谈优化。
选一条适合自己的安装路径
如果你用的是Windows,最省事的办法是下载官方提供的一键整合包:解压后双击start_web.bat,浏览器会自动打开操作界面,Python、ffmpeg这些依赖全都打包好了,不用自己装任何环境。
如果你在macOS或Linux,或者想深度定制,就从源码跑:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py三步完成你的第一个视频
浏览器打开http://localhost:8501后,界面是左中右三栏,跟着走:
第一步,填配置。展开左侧的「系统配置」面板,填两样东西:LLM的API Key(负责写文案,选通义千问性价比最高)和图像生成服务的地址或密钥。如果你本地跑着ComfyUI,填上http://127.0.0.1:8188;想用云端就填RunningHub的API Key。
第二步,输主题。在「内容输入」框里,输入一句话,比如"为什么要养成阅读习惯"。想快速出片,选"AI生成内容"模式,系统会自动扩写成一篇带分镜的完整文案,默认5个分镜。
第三步,点生成。点击右侧的「🎬 生成视频」按钮,你会看到进度条依次跳动:生成文案→生成配图→合成语音→合成视频。5个分镜的视频,顺利的话两三分钟就能完成,成片自动保存在output/文件夹里。
整个过程,你没有碰过一次剪辑软件。官方文档里也有图文版走位:docs/zh/getting-started/quick-start.md,卡在哪一步翻哪一步。
第四关:看懂接力赛——那几分钟里发生了什么
为什么只输入一句话,就能得到一支完整的视频?因为AI内部跑了一场四棒接力赛。
第一棒:文案生成。大语言模型收到你的主题后,把它扩写成一篇文章,再切成若干分镜,每个分镜都带上对应的画面描述和配音文案。这一步决定了视频的"骨架"。
第二棒:配图规划。每个分镜的画面描述被转成图像生成提示词,交给图像模型逐一渲染。你可以在「视觉设置」里给提示词加一个前缀,来统一整支视频的画风,比如加上 "Minimalist black-and-white illustration" 就能得到极简线稿风。提示词模板、生成参数都在pixelle_video/config/目录下,随时可以微调。
第三棒:语音合成。分镜文案被送给TTS引擎转成旁白音频。系统会自动根据每句旁白的时长去匹配画面,保证声画同步。
第四棒:视频合成。所有分镜的图片、音频、字幕、BGM交给合成模块,用ffmpeg拼成最终成片。
整个流水线在pixelle_video/目录下清晰分层:services/管各环节能力,pipelines/管流程编排,prompts/管各类提示词。想深挖技术细节,可以从 docs/zh/development/architecture.md 开始。
第五关:把画面调成你的风格——模板、尺寸与提示词的三层组合
第一支视频出来后,大概率你会想:"风格能不能换成我喜欢的?"这一关就教你调画风,一共三层。
第一层:换模板,定整体布局
所有模板都放在templates/目录下,按分辨率分门别类:1080x1920是竖屏(适合抖音、小红书),1920x1080是横屏(适合B站、YouTube),还有1080x1080方形(适合信息流)。文件名前缀也有讲究:static_是纯文字版式,image_用AI图片做背景,video_用AI视频做背景。
举个具体的例子,同一支"读书感悟"的内容,用不同模板会呈现完全不同的气质:
- 想走知识权威感,选
image_book.html,书籍排版的气场很正
- 想突出科技感,选
image_modern.html,深紫背景配几何装饰很抓眼
- 想走治愈系路线,选
image_healing.html,水墨晕染加毛笔字很安静
- 想做轻松科普,选
image_cartoon.png对应的卡通模板,蓝天草地童趣十足
第二层:改提示词前缀,统一画风
模板决定"版式",提示词前缀决定"画质和画风"。在「视觉设置」里把英文风格描述填进Prompt Prefix,所有分镜的配图都会往这个方向靠。想要电影感,就加 "cinematic lighting, 4k, high detail";想要插画风,就换 "flat illustration, soft colors"。
第三层:调尺寸与参数,适配平台
图像尺寸、采样步数、CFG这些参数都可以在配置里改,按目标平台的规格来就行。三个层级叠加,你的视频就有了专属的辨识度。
第六关:给视频配上好嗓子——从免费语音到专属声线
画面到位了,声音也不能拖后腿。Pixelle-Video的语音部分,丰俭由人。
默认方案是Edge-TTS,微软提供的免费语音合成,稳定够用,零成本。在pixelle_video/tts_voices.py里可以看到所有内置音色,中英文、男女声都能选。
进阶方案是Index-TTS这类支持声音克隆的引擎:上传一段参考音频,AI就能模仿它的音色说话。想给自己做一支"个人专属声线"的读书分享视频?录30秒你自己的声音传上去,后面的视频就都是"你"在讲了。
实用建议:语速一般设在0.8到1.2倍之间最自然;同一个文案可以多试几款音色,选中听的那个再批量生产。语音工作流支持自定义,懂ComfyUI的话,把自己的TTS工作流放进workflows/目录即可,系统会自动扫描识别。
第七关:算清这笔账——三条路线,从零成本到全云端
很多人关心的实际问题:这么强的自动化,得花多少钱?答案是,它可以一分钱不花。根据你的硬件情况,三条路线任选:
| 路线 | 配置组合 | 适合谁 | 大概成本 |
|---|---|---|---|
| 本地全免费 | Ollama跑文案 + 本地ComfyUI生图 + Edge-TTS配音 | 手里有显卡的用户 | 0元 |
| 云端经济 | 通义千问写稿 + RunningHub生图 | 无显卡、预算有限 | 每月一杯奶茶钱 |
| 全云端省心 | OpenAI + 云端图像服务 | 追求省事、不计较成本 | 费用较高但零维护 |
如果手里有一张像样的显卡,我强烈建议走本地全免费路线:LLM用Ollama在本地跑,图像用ComfyUI调用本地GPU,配音用免费的Edge-TTS,全程不产生一分钱API费用,数据也全部留在自己电脑上。没有显卡的话,通义千问的API成本大约是GPT的十分之一,配合按次计费的RunningHub,同样是性价比极高的组合。
配置文件的写法在config.example.yaml里都有注释,照着填llm、comfyui、api_providers几段就能切换路线,全程不用改代码。
第八关:开启生产线——从"做一支"到"做一打"的跃迁
当你对单支视频的流程驾轻就熟后,就该考虑效率了。Pixelle-Video的批量模式,能把"手工小作坊"升级成"流水线工厂"。
在内容输入区切到批量模式,每行输入一个主题,点击生成后,系统会为每个主题独立跑完整个流程。同一批视频会自动写入历史记录页面,方便回看、下载和管理。曾经要花一周才能排完的系列视频,现在一个下午就能出片。
给你一组直观的数字对比:传统方式制作一个3分钟短视频,从写脚本到剪辑成片,熟练工也要3到4个小时,外包的话一个视频几百块;用这套自动生成流程,单支视频5到10分钟,成本几乎可以忽略。效率提升不是百分之几十,而是数量级的差距。
批量生产的节奏感也有讲究:先拿一个主题试跑,确认文案风格、画风和音色都满意了,再批量铺开,避免整批返工。相似主题的视频放在同一批生成,后期管理和发布也更省心。
终局:现在,输入你的第一个主题
八关走完,你其实已经掌握了别人需要几个月才能摸清的完整路径。接下来,行动比任何技巧都重要:
- 今天就生成第一支视频——挑一个你真正感兴趣的主题,哪怕只有5个分镜,先让结果落地
- 跑通后再做第二支——这次换一个模板,感受画风差异
- 存好你满意的配置——把验证过的模板、提示词前缀、音色组合记下来,慢慢沉淀成自己的创作配方
- 需要时翻官方文档——模板系统详解在 docs/zh/user-guide/templates.md,风格定制教程在 docs/zh/tutorials/custom-style.md,声音克隆看 docs/zh/tutorials/voice-cloning.md
还记得开头那个问题吗?你一直没能做成视频,不是因为你不会,而是因为你走的是一条要求全能的路。现在,另一条路就在眼前:输入一句话,剩下的交给AI。你的第一个主题,想好了吗?
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考