news 2026/9/4 15:18:02

Pixelle-Video:零基础 5 分钟生成一条 AI 短视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Pixelle-Video:零基础 5 分钟生成一条 AI 短视频

Pixelle-Video:零基础 5 分钟生成一条 AI 短视频

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

一条 60 秒的竖版短视频,手工路线是:写脚本 40 分钟,找素材 90 分钟,时间线上剪 2 小时——一天根本剪不出 3 条。Pixelle-Video 是开源的 AI 全自动短视频引擎,你只负责给一句主题,文案、AI 配图、配音、背景音乐、成片拼接它全包,5 个分镜的成品通常 2-4 分钟就能出炉,零剪辑基础也能跑通。

5 步流水线:主题进、成片出的拆解

点下「🎬 生成视频」之后,后台pixelle_video/pipelines/里的标准流水线会按 5 步走:

  • 脚本引擎:LLM(负责写文字的大语言模型)把你的一句主题拆成默认 5 个分镜,每段旁白对应一帧画面,产物是一份结构化分镜脚本。
  • 画面描述师:为每段旁白生成一句英文画面描述,并自动拼上你在配置里写的风格前缀,产物是 5 条生图提示词。
  • AI 生图员:按你选的工作流逐张出图,可以走本地 ComfyUI(免费)、RunningHub 云端,或直连 DashScope、OpenAI 等 API,产物是 5 张配图。
  • TTS 配音员:Edge-TTS 或 Index-TTS 把 5 段旁白念出来,产物是 5 段 mp3 语音。
  • 合成器:把配图、语音按你选的 HTML 模板排版成帧,再叠上 BGM、用 ffmpeg 拼成 1080x1920 成片。

整条链路里你唯一要做的事就是盯进度条,中间产物都留在output/的任务文件夹里,哪一步不满意都可以单独复用。

第一次跑通:从 0 到出片的完整路径

两个入口一句话区分:Windows 直接下载官方一键整合包(内置 Python、ffmpeg 等全部依赖),解压后双击start_web.bat;macOS / Linux 从源码启动,先装好uvffmpeg,再在仓库目录运行uv run streamlit run web/app.py

  1. 启动并等浏览器打开 http://localhost:8501。看到三栏布局(左栏输入内容、中栏语音和视觉设置、右栏生成按钮)就说明起来了。卡住先看终端有没有报错,最常见的是 ffmpeg 没装或 PATH 没配对。
  2. 展开「⚙️ 系统配置」配 LLM。从预设下拉里选通义千问,页面会自动填好 base_url 和 model,你只需补上 API Key 并点「保存配置」。看到配置面板下方出现绿色保存提示即成功。
  3. 同一面板里配图像工作流。选runninghub/image_flux.json就填 RunningHub 的 API Key;想用本地 ComfyUI 就选selfhost/前缀的工作流并填http://127.0.0.1:8188,点「测试连接」绿灯后再走下一步。

  1. 左侧输入主题。保持「AI 生成内容」模式,输入「为什么要养成阅读习惯」,分镜数保持默认 5,中栏模板保持1080x1920/image_default.html
  2. 点「🎬 生成视频」并让出去 3 分钟。进度条依次走过「生成文案 → 生成配图 → 合成语音 → 合成视频」,中途会看到「分镜 3/5 - 生成插图」这类字样;5 个分镜大约 2-4 分钟跑完。完成后右侧自动播放成片,视频文件落在output/目录的任务文件夹里,文案、配音、配图等中间产物也都在。

三种典型用法:博主、电商、教师各取所需

小林的知识号:她运营小红书读书号,每周要 3 条视频,手动做一条 4 小时,一周就是 12 小时坐在时间线前。每周三晚上,她把 5 个主题一行一个塞进批量模式的输入框,模板固定1080x1920/image_modern.html,TTS 里上传了自己 30 秒的试读录音做音色克隆,然后关电脑睡觉。早上打开历史页,5 条 60 秒左右的竖屏成片整齐躺着,单条 API 成本约 2-5 分钱,一条 12 小时的剪辑时间被压到 0。发布后评论区有人问「小林你是不是换了配音」——那声音本来就是她自己,只是被 Index-TTS 克隆了一遍。

电商团队的方形产品卡:用1080x1080/image_minimal_framed.html模板,切到「固定文案内容」模式直接粘贴现成的卖点文案,图像尺寸设 1024x1024。一条 15 秒产品卡大约 90 秒出炉,晚上排 10 个 SKU,第二天早上 10 条卡全在历史页。

教师的横屏课件片段:知识点讲给投影看,选1920x1080分组的模板(如image_film.html),分镜数调到 3 控制时长,一条 90 秒的课件片段 2 分钟左右跑完,比录屏剪辑快得多。

三套配置方案 + 最容易翻车的 3 处

方案名适用条件核心参数组合单条时间成本一句话点评
完全免费本地有 NVIDIA 显卡Ollama(llama3.2)+ ComfyUI 本地工作流3-6 分钟,0 元 API数据不出门,显卡不够就别硬上
云端经济无显卡、预算敏感通义千问(qwen-max)+ RunningHub 云端工作流2-4 分钟,API 约 2-5 分/条新手默认选这档最稳
专业混合追求画质与出片速度GPT 文案 + DashScope / Kling 直连 API 媒体模型2 分钟左右,按量付费效果上限最高,账单也得跟着算
  • LLM 只填了 api_key→ base_url 漏了,请求打到错误地址,文案阶段直接报 connection error → 在 WebUI 里用预设下拉选模型,它会自动带出 base_url,别手动半填。
  • 卡在「生成配图」不动→ 工作流前缀和密钥类型不匹配,selfhost/需要本地 ComfyUI 在跑,runninghub/需要 RunningHub Key → 回到「⚙️ 系统配置」核对前缀与密钥是否对应。
  • 画面空白或文字堆叠→ 模板类型和素材类型对不上,比如选了video_模板却只配了图像工作流 → 换回image_模板,或补一个视频生成工作流。

进阶解锁:3 个超出预期的玩法

你本来以为配音只能用机器味音色,其实你可以上传一段 30 秒参考音频做声音克隆——在「🎤 语音设置」里选支持克隆的 TTS 工作流(如 Index-TTS),拖进 MP3 点「试听」,开口就是「你」本人的声音,连鼻音都保留。

你本来以为每个分镜的配图风格会飘,其实你可以用提示词前缀锁死全片画风——在config.example.yaml复制出的config.yaml里给image.prompt_prefix写一句英文风格描述(比如 minimalist black-and-white matchstick figure style, clean lines),再点「预览风格」试一张,整条片子就像出自同一个设计师之手。

你本来以为静态照片只能当背景,其实图生视频和动作迁移流水线能把一张产品图变成会动的镜头——在扩展工作流里传一张照片和一段参考视频,参考视频里的动作会「搬」到照片上,跳舞的小猫、开口的人物都做得出来。

资源导航:4 个关键入口

  • 官方文档 docs/zh/:装依赖、配 Key 遇到问题时先翻这里,安装、配置、快速开始都有中文教程。
  • 模板库 templates/:30 多套 HTML 模板按1080x19201920x10801080x1080分文件夹存放,想改品牌色就动手改 CSS。
  • 预置工作流 workflows/:runninghub/selfhost/两个目录放齐了图像、视频、TTS 的 JSON 工作流,会 ComfyUI 的可以直接往里加自己的。
  • 音色清单 pixelle_video/tts_voices.py:配语音前先来这挑,全部支持的 TTS 音色都列在这里。
  • 官方 Issue 区:跑不动、报错信息贴出来前,先看看是不是已有同样问题被解答过。

现在就动手:10 分钟出第一条成片

把这条命令拷进终端:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video && cd Pixelle-Video && uv run streamlit run web/app.py

浏览器跳开后,选一个 LLM 预设填 Key、敲一个你早就想讲的主题、点「🎬 生成视频」。去泡杯美式,等那杯咖啡凉透之前,你的第一条成片应该已经在output/目录里了。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 15:16:27

医疗内窥镜传感器企业采购真空共晶炉:低空洞焊接工艺与设备选型要点

医用内窥镜图像传感器与陶瓷基板互连的焊接质量直接决定成像噪点与长期可靠性。焊接界面的空洞不仅造成局部热阻升高,更会在高温工作环境下引发焊层蠕变疲劳。对于要求零缺陷的医疗级器件,医疗内窥镜传感器企业采购真空共晶炉需重点关注真空能力与温度场…

作者头像 李华
网站建设 2026/9/4 15:15:05

在 Windows 7 上部署 Internet 打印服务

Windows 7 系统可以通过配置 Internet 打印服务(Internet Printing Protocol, IPP)实现基于 Web 的打印机共享。以下是详细部署方法:安装 IIS 服务进入控制面板→程序→打开或关闭 Windows 功能,勾选以下组件:IIS 管理…

作者头像 李华
网站建设 2026/9/4 15:14:22

从CANoe/UDS到HiL项目:为什么精通工具仍做不了事?

博主干了七八年汽车电子测试,从刚入行拿着CANoe连报文都看不懂的菜鸟,到后来独立搭建过好几套HiL台架,也面试过不少自称“熟悉CANoe和UDS”的候选人。最近有个现象特别有意思:不少工程师把CAPL写得飞起、UDS各服务号背得滚瓜烂熟&…

作者头像 李华
网站建设 2026/9/4 15:09:55

GaN功率器件设计实战:从驱动布局到双脉冲测试的完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 15:07:35

RPA网页自动化中的IF条件组件:用元素状态驱动流程分支

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华