Pixelle-Video 入门:10 分钟从一句话主题到一条 AI 短视频自动成片
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一个开源的 AI 全自动短视频引擎。你只需输入一个主题,它自动完成文案撰写、AI 配图、语音解说、背景音乐混入和最终成片合成。读完本文,你能在本地跑起 Web 服务,亲手生成第一条成片。
左栏输入主题,中栏配置语音与视觉,右栏生成并预览成片
一句话主题进去,一条成片出来
Pixelle-Video 把做短视频的每个环节都自动化了,你不用打开剪辑软件,也不用逐帧排版。整条流水线分四段。
文案与分镜。LLM 根据你的主题写稿,并默认拆成 5 个分镜。稿件已有?切到「固定文案内容」模式,可按段落、按行或按句子拆分。模型在配置文件的llm字段里填写,凡是 OpenAI SDK 格式的接口都能接:通义千问、GPT、DeepSeek,甚至本地 Ollama。
图像与视频制作。三条路线可切换:本地 ComfyUI(workflows/selfhost/ 目录下的工作流)、云端 RunningHub(workflows/runninghub/)、直连供应商 API(DashScope、OpenAI、Seedream、Kling 等,在api_providers配置)。图像默认尺寸 1024x1024,整体画风由提示词前缀控制。
解说与背景音乐。TTS 默认走 Edge-TTS 工作流(selfhost/tts_edge.json),也可选 Index-TTS:上传一段参考音频即可克隆音色。自定义 BGM 更简单,MP3/WAV 文件放进根目录bgm/文件夹就能被选上。
模板合成。模板集中在 templates/ 目录,按竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三组存放。文件名即类型:static_*是纯文字,image_*用 AI 图片做背景,video_*用 AI 视频做背景。成片最终输出到output/文件夹。
场景实战:从零做一条横屏科普视频
我们完整走一遍,目标是一条横屏科普片。
准备环境。工具在本地跑,只需要两样:ffmpeg(负责最后的视频合成)和 Python 3.11 以上。macOS 执行brew install ffmpeg,Ubuntu/Debian 执行sudo apt install ffmpeg,装完用ffmpeg -version确认有输出。uv 是一个快速的 Python 包管理器,用它一条命令搞定依赖。
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.pyuv run会自动建虚拟环境并装齐全部依赖。没有环境折腾的 Windows 用户,直接下 Windows 整合包,双击start.bat就能启动。
打开界面做首次配置。服务起来后,浏览器自动打开http://localhost:8501。首次使用先展开左侧「⚙️ 系统配置」面板:在 LLM 配置里选一个预设模型,粘贴 API Key,点「保存配置」。
发起第一次生成。左侧「内容输入」切到「AI 生成内容」模式,输入主题。这里有个小经验:具体知识点出片更好,比如「黑洞的形成原理」比「宇宙」这种大词聚焦得多。中间栏保持默认:TTS 用 Edge-TTS,图像工作流用默认的runninghub/image_flux.json,本地什么都不用装。模板选 templates/1920x1080/image_wide_darktech.html,16:9 横屏,发 B 站和 YouTube 都合适。右侧点「生成视频」,进度条会按「生成文案 → 分镜 N/5 生成配图 → 合成语音 → 合成视频」推进,5 个分镜全程约 2-5 分钟。
「Wide Darktech」模板,暗色科技风,适合科普内容
合成完成右侧自动播放,显示时长、文件大小和分镜数。视频文件在output/,历史页面里也能回看。
「Film」模板,电影质感,适合横屏解说
三个决定成片质量的配置
配图路线怎么选。出片速度和成本的最大变量是图从哪来。有 NVIDIA 显卡且本地部署了 ComfyUI,选selfhost工作流,最快还免费;没有显卡,选 RunningHub 工作流并在系统配置面板填 API Key;手里只有云 API Key,就选api/...工作流,再到api_providers填对应供应商密钥。易错提醒:选了 selfhost 但本地 ComfyUI 没启动、或模型文件缺失,流程会卡在「生成配图」一步。先点「测试连接」确认服务可达再开工。
模板怎么自定义。模板文件就是 HTML + CSS,文字和图片通过 Jinja2 变量{{ title }}、{{ text }}、{{ image }}注入。想做出自己的风格:复制 templates/1920x1080/ 里一个现有模板,改样式后存为.html放进对应尺寸目录,它会自动出现在模板下拉列表里。易错提醒:模板body尺寸必须和所在目录一致(竖屏目录写1080px × 1920px),否则文字排版会溢出画面。
解说音色和 BGM 怎么定。解说质量取决于 TTS 工作流和参考音频。选 Index-TTS,上传一段清晰的人声 MP3,旁白就是这个音色;生成前点「预览语音」先试听,这是验证效果成本最低的方式。易错提醒:声音克隆只在支持的工作流(如 Index-TTS)下生效,选了 Edge-TTS 上传参考音频不会有任何作用。
5 个高频故障速查
Web 界面启动报错或打不开。原因:ffmpeg 没装,或 Python 版本低于 3.11。处理:先装 ffmpeg 并用ffmpeg -version验证;依赖安装失败时执行uv cache clean再重新uv sync。
ComfyUI 连接失败。原因:本地 ComfyUI 服务没启动,或 URL 配错。处理:先确认浏览器能访问默认地址http://127.0.0.1:8188,再到配置面板点「测试连接」。
LLM 调用失败,文案生成不出来。原因:API Key 有误、余额不足或网络不通。处理:核对系统配置面板中的 Key 是否完整;用本地 Ollama 时,确认服务已启动且模型已拉取。
配图风格和模板不搭。原因:提示词前缀用了中文,或图像尺寸超出模型支持范围。处理:前缀写英文画风词(如 minimal sketch style 这类描述),宽高调到模型允许的范围内。
生成速度慢。原因:分镜数量多,或高峰期走云端 API。处理:把分镜数从 5 调少;有本地 GPU 时改用 selfhost 工作流,比云端快。
一条主题进,一条成片出,写稿、配图、配音、合成全部自动完成。想深入玩自定义视觉风格、声音克隆,docs/zh/ 里有分场景的中文教程,照着往下试即可。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考