Pixelle-Video:零基础 5 分钟生成一条 AI 短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
一条 60 秒的竖版短视频,手工路线是:写脚本 40 分钟,找素材 90 分钟,时间线上剪 2 小时——一天根本剪不出 3 条。Pixelle-Video 是开源的 AI 全自动短视频引擎,你只负责给一句主题,文案、AI 配图、配音、背景音乐、成片拼接它全包,5 个分镜的成品通常 2-4 分钟就能出炉,零剪辑基础也能跑通。
5 步流水线:主题进、成片出的拆解
点下「🎬 生成视频」之后,后台pixelle_video/pipelines/里的标准流水线会按 5 步走:
- 脚本引擎:LLM(负责写文字的大语言模型)把你的一句主题拆成默认 5 个分镜,每段旁白对应一帧画面,产物是一份结构化分镜脚本。
- 画面描述师:为每段旁白生成一句英文画面描述,并自动拼上你在配置里写的风格前缀,产物是 5 条生图提示词。
- AI 生图员:按你选的工作流逐张出图,可以走本地 ComfyUI(免费)、RunningHub 云端,或直连 DashScope、OpenAI 等 API,产物是 5 张配图。
- TTS 配音员:Edge-TTS 或 Index-TTS 把 5 段旁白念出来,产物是 5 段 mp3 语音。
- 合成器:把配图、语音按你选的 HTML 模板排版成帧,再叠上 BGM、用 ffmpeg 拼成 1080x1920 成片。
整条链路里你唯一要做的事就是盯进度条,中间产物都留在output/的任务文件夹里,哪一步不满意都可以单独复用。
第一次跑通:从 0 到出片的完整路径
两个入口一句话区分:Windows 直接下载官方一键整合包(内置 Python、ffmpeg 等全部依赖),解压后双击start_web.bat;macOS / Linux 从源码启动,先装好uv和ffmpeg,再在仓库目录运行uv run streamlit run web/app.py。
- 启动并等浏览器打开 http://localhost:8501。看到三栏布局(左栏输入内容、中栏语音和视觉设置、右栏生成按钮)就说明起来了。卡住先看终端有没有报错,最常见的是 ffmpeg 没装或 PATH 没配对。
- 展开「⚙️ 系统配置」配 LLM。从预设下拉里选通义千问,页面会自动填好 base_url 和 model,你只需补上 API Key 并点「保存配置」。看到配置面板下方出现绿色保存提示即成功。
- 同一面板里配图像工作流。选
runninghub/image_flux.json就填 RunningHub 的 API Key;想用本地 ComfyUI 就选selfhost/前缀的工作流并填http://127.0.0.1:8188,点「测试连接」绿灯后再走下一步。
- 左侧输入主题。保持「AI 生成内容」模式,输入「为什么要养成阅读习惯」,分镜数保持默认 5,中栏模板保持
1080x1920/image_default.html。 - 点「🎬 生成视频」并让出去 3 分钟。进度条依次走过「生成文案 → 生成配图 → 合成语音 → 合成视频」,中途会看到「分镜 3/5 - 生成插图」这类字样;5 个分镜大约 2-4 分钟跑完。完成后右侧自动播放成片,视频文件落在
output/目录的任务文件夹里,文案、配音、配图等中间产物也都在。
三种典型用法:博主、电商、教师各取所需
小林的知识号:她运营小红书读书号,每周要 3 条视频,手动做一条 4 小时,一周就是 12 小时坐在时间线前。每周三晚上,她把 5 个主题一行一个塞进批量模式的输入框,模板固定1080x1920/image_modern.html,TTS 里上传了自己 30 秒的试读录音做音色克隆,然后关电脑睡觉。早上打开历史页,5 条 60 秒左右的竖屏成片整齐躺着,单条 API 成本约 2-5 分钱,一条 12 小时的剪辑时间被压到 0。发布后评论区有人问「小林你是不是换了配音」——那声音本来就是她自己,只是被 Index-TTS 克隆了一遍。
电商团队的方形产品卡:用1080x1080/image_minimal_framed.html模板,切到「固定文案内容」模式直接粘贴现成的卖点文案,图像尺寸设 1024x1024。一条 15 秒产品卡大约 90 秒出炉,晚上排 10 个 SKU,第二天早上 10 条卡全在历史页。
教师的横屏课件片段:知识点讲给投影看,选1920x1080分组的模板(如image_film.html),分镜数调到 3 控制时长,一条 90 秒的课件片段 2 分钟左右跑完,比录屏剪辑快得多。
三套配置方案 + 最容易翻车的 3 处
| 方案名 | 适用条件 | 核心参数组合 | 单条时间成本 | 一句话点评 |
|---|---|---|---|---|
| 完全免费 | 本地有 NVIDIA 显卡 | Ollama(llama3.2)+ ComfyUI 本地工作流 | 3-6 分钟,0 元 API | 数据不出门,显卡不够就别硬上 |
| 云端经济 | 无显卡、预算敏感 | 通义千问(qwen-max)+ RunningHub 云端工作流 | 2-4 分钟,API 约 2-5 分/条 | 新手默认选这档最稳 |
| 专业混合 | 追求画质与出片速度 | GPT 文案 + DashScope / Kling 直连 API 媒体模型 | 2 分钟左右,按量付费 | 效果上限最高,账单也得跟着算 |
- LLM 只填了 api_key→ base_url 漏了,请求打到错误地址,文案阶段直接报 connection error → 在 WebUI 里用预设下拉选模型,它会自动带出 base_url,别手动半填。
- 卡在「生成配图」不动→ 工作流前缀和密钥类型不匹配,
selfhost/需要本地 ComfyUI 在跑,runninghub/需要 RunningHub Key → 回到「⚙️ 系统配置」核对前缀与密钥是否对应。 - 画面空白或文字堆叠→ 模板类型和素材类型对不上,比如选了
video_模板却只配了图像工作流 → 换回image_模板,或补一个视频生成工作流。
进阶解锁:3 个超出预期的玩法
你本来以为配音只能用机器味音色,其实你可以上传一段 30 秒参考音频做声音克隆——在「🎤 语音设置」里选支持克隆的 TTS 工作流(如 Index-TTS),拖进 MP3 点「试听」,开口就是「你」本人的声音,连鼻音都保留。
你本来以为每个分镜的配图风格会飘,其实你可以用提示词前缀锁死全片画风——在config.example.yaml复制出的config.yaml里给image.prompt_prefix写一句英文风格描述(比如 minimalist black-and-white matchstick figure style, clean lines),再点「预览风格」试一张,整条片子就像出自同一个设计师之手。
你本来以为静态照片只能当背景,其实图生视频和动作迁移流水线能把一张产品图变成会动的镜头——在扩展工作流里传一张照片和一段参考视频,参考视频里的动作会「搬」到照片上,跳舞的小猫、开口的人物都做得出来。
资源导航:4 个关键入口
- 官方文档 docs/zh/:装依赖、配 Key 遇到问题时先翻这里,安装、配置、快速开始都有中文教程。
- 模板库 templates/:30 多套 HTML 模板按
1080x1920、1920x1080、1080x1080分文件夹存放,想改品牌色就动手改 CSS。 - 预置工作流 workflows/:
runninghub/与selfhost/两个目录放齐了图像、视频、TTS 的 JSON 工作流,会 ComfyUI 的可以直接往里加自己的。 - 音色清单 pixelle_video/tts_voices.py:配语音前先来这挑,全部支持的 TTS 音色都列在这里。
- 官方 Issue 区:跑不动、报错信息贴出来前,先看看是不是已有同样问题被解答过。
现在就动手:10 分钟出第一条成片
把这条命令拷进终端:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video && cd Pixelle-Video && uv run streamlit run web/app.py
浏览器跳开后,选一个 LLM 预设填 Key、敲一个你早就想讲的主题、点「🎬 生成视频」。去泡杯美式,等那杯咖啡凉透之前,你的第一条成片应该已经在output/目录里了。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考