输入一个主题就能出片:Pixelle-Video AI 短视频引擎完整新手教程
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一个 AI 全自动短视频引擎,你用一句话写下视频主题,它就把文案撰写、AI 配图、语音解说、背景音乐和最终合成全部包办下来,最后直接给你一个能发布的短视频文件。整个过程不需要你会剪辑、会写脚本,也不强制你懂技术,跟着这篇教程走,第一次就能跑出自己的第一条 AI 短视频。
Pixelle-Video 替你解决了什么问题
做一条短视频,传统上要干五件事:写脚本、找配图、录配音、挑音乐、进剪辑软件拼画面。哪怕每件事都只用十几分钟,加起来也是一小时起步,而且每一步都要你自己动手。
Pixelle-Video 的思路是把这五件事都交给 AI,你只负责"出主意"。整个流程在一条流水线上完成:
输入文本 → 生成剧本 → 生成配图提示词 → 生成音频/图片/合成帧 → 拼接+BGM → 输出视频具体来说,它会为你完成这些事:
| 环节 | 它做什么 | 你做什么 |
|---|---|---|
| 文案 | 根据你的主题自动写解说词,并拆成若干分镜 | 给一个主题,或直接贴入自己的文案 |
| 配图 | 每个分镜自动生成一张风格统一的插图 | 选模板、调提示词前缀(可选) |
| 配音 | 调用 TTS 把文案读成语音 | 选一个语音工作流,上传参考音频可克隆音色 |
| 音乐 | 给视频铺上背景音乐 | 选无 BGM、内置音乐,或往bgm/目录扔自己的 MP3 |
| 合成 | 把画面、语音、音乐拼成成片 | 等进度条走完,视频自动播放并保存到output/ |
它还支持三种扩展玩法,对新手来说相当于"免费加餐":上传自己的照片和视频做「自定义素材」,AI 分析后反推脚本;用图生视频把静态图变成动态画面;用「数字人口播」让虚拟人替你出镜。
三步启动 Pixelle-Video 并生成第一条视频
第一步:装好并启动
按你的系统二选一:
Windows:去项目 Releases 下载 Windows 一键整合包,解压后双击start.bat。这个包把 Python、uv、ffmpeg 全打包好了,完全不用装环境。
macOS / Linux:从源码安装,需要你先装好uv(Python 包管理器)和ffmpeg(视频处理工具),然后执行:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py两种方式启动后,浏览器都会自动打开http://localhost:8501的 Web 界面。
第二步:配置一次 API
首次使用要展开「⚙️ 系统配置」面板,填两类信息,之后就不用再动了:
- LLM 配置:选一个大语言模型(通义千问、GPT、DeepSeek 都行)并填入 API Key,这是负责写文案的。有本地显卡的用户可以用 Ollama 跑本地模型,一分钱不花。
- 图像/视频生成:三条路任选其一——本地 ComfyUI(填地址后点「测试连接」)、云端 RunningHub(填 API Key),或直连 DashScope、OpenAI、可灵、Seedream 等模型厂商的 API。只跑图不加视频的话,配好图像这一项就够了。
费用上不用太担心:本地 ComfyUI + Ollama 是零成本方案;用通义千问写文案的成本极低;全云端方案最省事但贵一些。
第三步:输入主题,点生成
界面是三栏布局,跟着走就行:
- 左侧「📝 内容输入」:选「AI 生成内容」模式,输入主题,比如"为什么要养成阅读习惯"。也可以选「固定文案内容」直接贴自己的稿子,跳过 AI 写稿。
- 中间栏:语音设置里挑一个 TTS 工作流(默认 Edge-TTS 就能用),视觉设置里选图像工作流和视频模板(推荐竖屏 1080x1920,默认 5 个分镜)。
- 右侧栏:点「🎬 生成视频」,进度条会依次显示生成文案、逐分镜生成插图、合成语音、合成视频。5 个分镜的片子大约 2~5 分钟出片,完成后右侧直接播放,文件落在
output/文件夹里。
最实用的几个功能:模板、音色克隆和批量生成
模板决定视频长什么样
模板分三类,从命名就能看懂:static_*.html是纯文字静态模板(不用 AI 生成媒体,速度快),image_*.html用 AI 生成的图片做背景,video_*.html用 AI 生成的视频做动态背景。
模板按尺寸分竖屏(1080x1920,适合抖音、小红书)、横屏(1920x1080,适合 B 站、YouTube)、方形(1080x1080)三组,在界面下拉菜单里按尺寸分组显示,点「预览模板」还能填参数先看效果再决定。风格从简约现代到复古时尚都有,竖屏模板就有书籍、治愈、霓虹、卡通、长文本等二十多种。
声音克隆:让 AI 用"你的声音"配音
在语音设置里上传一段参考音频(MP3/WAV/FLAC 均可),选择支持声音克隆的 TTS 工作流(如 Index-TTS),AI 就能模仿这个音色来念你的文案。上传后可以直接试听效果,不满意换一段再传。
批量模式:一次生成一组视频
需要日更或者做系列内容的用户,把「🔢 批量生成模式」打开即可:每行输入一个主题,系统会为每个主题各出一条视频,并且共用同一套 TTS、模板、工作流配置。好处很直接——系列视频的视觉风格天然统一,你只需要把主题列好,然后去干别的事。
自定义素材:你的照片也能变成视频
除了纯 AI 生成,你还可以上传自己的照片和视频,AI 会分析这些素材并围绕它生成脚本,适合手里有实拍素材但懒得写文案的人。
什么内容最适合用它来做
Pixelle-Video 生成的片子形态是"一张(或一段)画面 + 解说词 + 配音 + BGM",所以它特别适合以信息传递为主的竖屏内容:
- 知识科普:养生常识、效率方法、行业入门,AI 写稿能力在这类主题上最稳;
- 读书/历史/文化解读:搭配书籍风格或水墨风模板,配上克隆音色,很像你在刷到的那种"文化解说号";
- 个人成长与情感:治愈、生活感悟类,选治愈系模板和柔和的音色,氛围感直接到位;
- 固定栏目批量更新:一个账号每周三、五各更一条,用批量模式一次排好,风格永远一致。
相对而言,强情节、多机位、真人出镜的内容不适合它,它的甜区就是"一个话题讲明白"的单画面解说视频。
遇到问题先看这四处
大部分"生成失败"都出在四个地方,按顺序排查基本能解决:
- LLM 调用失败:先核对 API Key 填对没有、网络通不通、账户余额够不够。文案是整条流程的起点,它不跑通后面全都白搭。
- ComfyUI 连不上:确认 ComfyUI 服务正在运行,地址一般是
http://127.0.0.1:8188,在配置面板点「测试连接」最直观;还连不上就在浏览器里直接访问这个地址试试。 - 图像/视频生成失败:多半是 ComfyUI 里缺对应模型,或者工作流 JSON 文件不完整。可以先在 ComfyUI 里手动跑一遍同一工作流验证。
- 生成太慢:换本地 ComfyUI(比云端快)、减少分镜数量、换个响应更快的 LLM,这三招立竿见影。
依赖装不上时,用uv cache clean清缓存再uv sync重装一次通常就好。更详细的问题清单在 docs/zh/troubleshooting.md,运行日志在项目根目录的api_server.log,报错信息基本都能在里面找到。
想玩得更深:自定义模板、工作流和 API
三个进阶方向,用到哪个看哪个:
- 自定义模板:模板就是 templates/ 目录下的 HTML 文件,会一点 HTML/CSS 就能改布局、颜色、字体,或者照现有模板抄一个改出来。新建文件按
static_/image_/video_前缀命名,Web 界面会自动识别并按尺寸归类。 - 自定义工作流:图像、视频、TTS 三类能力都对应 workflows/ 下的 ComfyUI 工作流 JSON。自己在 ComfyUI 里搭好工作流、导出 JSON 丢进这个目录,界面下拉菜单里就能选到。不想搭 ComfyUI 的话,直连 API 厂商的工作流也已经预置好,填 Key 就能用。
- API 集成:想把这个能力嵌进自己的程序,可以用 Python 接口
PixelleVideoCore调用,传入主题和分镜数,异步返回视频文件路径;同时项目带了一组 REST 接口(api/ 目录),支持提交任务、查进度、取结果,详见 docs/zh/user-guide/api.md。
跑通第一条视频之后,建议先去历史记录页回看之前生成的片子和参数,再针对不满意的地方换模板、换音色各试一轮——你会发现,改一个参数就能得到一个完全不同的片子,这正是这个工具最好玩的地方。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考