Pixelle-Video 快速上手指南:只输入一个主题,5 分钟生成完整 AI 短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一款开源的 AI 全自动短视频引擎:输入一个主题,它会自动完成文案撰写、AI 配图、语音合成、背景音乐和最终视频合成,全程不需要剪辑软件。适合想批量生产口播、科普、书单类短视频,但没有剪辑经验的个人创作者和小团队,也适合想接入 API 做自动化内容流水线的开发者。
5 分钟跑通:安装、配置、启动
启动前只需准备两个依赖:Python 包管理器uv和视频处理工具ffmpeg(macOS 用brew install ffmpeg,Ubuntu 用sudo apt install ffmpeg)。
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501。Windows 用户可以直接下载 Releases 里的一键整合包,解压后双击start.bat即可,无需安装 Python 和 ffmpeg。
首次使用要展开「⚙️ 系统配置」面板,填三组信息:
- LLM 配置:选预设(通义千问、GPT-4o、DeepSeek、Ollama 本地模型)会自动填充
base_url和model,再填 API Key - ComfyUI / RunningHub 配置:本地部署填 ComfyUI 地址(默认
http://127.0.0.1:8188),云端则填 RunningHub API Key - API 媒体模型配置:不依赖 ComfyUI 时,直连 OpenAI、DashScope、火山 ARK(Seedream/Seedance)、可灵等供应商的图像/视频服务
配置也可写在 config.example.yaml(复制为config.yaml填写)。保存后即可开始生成。
跟着走一遍核心流程:从「主题」到成片
整条流水线是「文案生成 → 配图规划 → 逐帧处理 → 视频合成」,以生成一个主题为「为什么要养成阅读习惯」的视频为例:
- 内容输入(左侧栏):选「AI 生成内容」模式,输入主题,默认生成 5 个分镜,数量可调
- 语音设置(中间栏):TTS 工作流默认 Edge-TTS 即可,无需任何配置
- 视觉设置(中间栏):图像工作流默认
image_flux.json,图像尺寸默认 1024x1024,视频模板选1080x1920/image_default.html(竖屏) - 点「🎬 生成视频」:右侧栏实时显示进度(如「分镜 3/5 - 生成插图」),5 分镜视频通常 2-5 分钟出片
- 预览与导出:成片自动播放,并显示时长、文件大小、分镜数;视频文件保存在
output/文件夹
如果对文案不满意,可以改用「固定文案内容」模式直接粘贴自己的稿子,跳过 AI 创作环节;固定脚本支持按段落、行、句子三种方式分割成分镜。
核心能力拆解
文案生成:两种模式
- AI 生成内容:LLM 根据主题写完整解说词,支持所有 OpenAI 兼容接口的模型。换不同模型,文案风格会有明显差异
- 固定文案内容:跳过创作,直接用自己的稿子,适合已有成熟脚本的账号
图像与视频生成:工作流 + 直连 API 双通道
原子能力可以按需替换。图像生成走 ComfyUI 工作流(workflows/ 下分runninghub/云端和selfhost/本地两套)或api/...直连供应商两种方式,内置 Flux、SDXL、Qwen、Seedream 等方案;视频生成内置 Wan 2.1/2.2 工作流(如video_wan2.1_fusionx.json),也支持直连 DashScope、可灵、Seedance。图像风格靠「提示词前缀」控制(英文描述,如Minimalist black-and-white matchstick figure style illustration),点「预览风格」可先试一张图再全量生成。
语音合成:Edge-TTS 起步,支持克隆音色
TTS 工作流自动扫描 workflows/ 目录,内置 Edge-TTS(免费、无需部署)和 Index-TTS 等。选中支持克隆的工作流后,上传一段 MP3/WAV 参考音频,上传后可直接试听预览,再做最终合成。多语言 TTS 音色开箱可用。
模板系统:30 个内置模板,按尺寸分组
模板用 HTML 定义画面,位于 templates/ 目录,按前缀区分三类:
| 前缀 | 是否消耗 AI 算力 | 适用场景 |
|---|---|---|
static_*.html | 否,纯文字渲染 | 金句卡、公告,生成极快 |
image_*.html | 每分镜生成 1 张图 | 图文口播、书单、科普 |
video_*.html | 每分镜生成 1 段视频 | 动态画面,表现力最强 |
数量上:竖屏 1080x1920 有 24 个模板(抖音、快手、小红书),横屏 1920x1080 有 5 个(B 站、YouTube),方形 1080x1080 有 1 个。模板支持{{ title }}、{{ text }}、{{ image }}三个 Jinja2 变量,会一点 HTML 就能复制现有模板改出自己的样式。背景音乐把 MP3/WAV 丢进bgm/文件夹即可被选中,支持试听。
进阶玩法
- 数字人口播:生成虚拟人物讲解视频,支持多语言(项目演示中有韩语数字人案例),适合课程推广
- 动作迁移:上传参考视频和图片,把参考视频中的动作迁移到新角色上(如跳舞小猫案例)
- 图生视频:选
video_*模板或动态工作流,用 Wan 2.1 等模型把静态画面变成动态片段 - 自定义素材:上传自己的照片和视频,AI 智能分析素材后生成匹配脚本,API 视频片段会尽量按旁白时长对齐
- 批量与历史:侧边栏历史记录页支持批量创建视频任务,RunningHub 并发数可在
runninghub_concurrent_limit里调到 1-10 - REST API:api/ 目录下提供完整的 FastAPI 服务(
api/app.py),涵盖内容、图像、TTS、视频、任务等路由,方便第三方系统集成 - Docker 部署:仓库提供 Dockerfile 和 docker-compose.yml
常见问题(FAQ)
Q:必须要部署 ComfyUI 吗?不一定。纯文字模板(static_*)完全不需要;要 AI 配图但不想本地部署,可用 RunningHub 云端或直连 API 供应商;本地有显卡才建议自托管 ComfyUI。
Q:跑一次要花多少钱?有三档方案:Ollama(本地 LLM)+ 本地 ComfyUI = 0 元;通义千问 + 本地 ComfyUI 约 0.01-0.05 元/视频,性价比最高;OpenAI + RunningHub 全云端最省事但费用最高。
Q:生成慢、卡在哪一步?看右侧进度条定位:文案慢多半是 LLM 响应,配图慢看图像工作流的网络和算力,合成阶段检查本机 ffmpeg 是否正常。5 分镜参考耗时 2-5 分钟。
Q:ComfyUI 连接失败怎么办?先确认本地 ComfyUI 服务已启动,再核对 URL(默认http://127.0.0.1:8188;Docker 环境下 Mac/Windows 要用host.docker.internal:8188),最后在 Web 界面点「测试连接」验证。
Q:成片效果不满意怎么调?按顺序试:换 LLM 模型改文案风格 → 改提示词前缀和图像尺寸换配图 → 换 TTS 工作流或传参考音频换声音 → 换模板和画幅。四个环节互相独立,改哪个都不影响其他设置。
小结与资源导航
Pixelle-Video 把「文案、配图、配音、合成」四件事拆成可替换的模块,你只需要在 Web 界面上选预设、填 Key、点生成。上手路径建议:先用 Edge-TTS + 云端图像服务跑通第一条竖屏视频,再逐步替换成自己偏好的模型和模板。
关键入口:
- 使用文档与教程:docs/zh/(含 快速开始、配置说明、FAQ)
- 配置示例:config.example.yaml
- 模板目录与效果图:templates/、docs/zh/user-guide/templates.md
- AI 工作流(RunningHub / 自托管):workflows/
- REST API 入口:api/app.py
- 社区与反馈:README 中的微信群 / Discord 二维码,或直接向仓库提交 Issue
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考