如何用 Open Generative AI 把一张静图变成 10 秒口型视频:14 个工作室实战指南
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个免费、开源的 AI 视频与图像生成工作室,它帮内容创作者把一段文字、一张静图或一段录音,变成口型视频和电影级宣传片。内置 400+ 模型、无内容过滤、可自托管,数据和创意都握在你自己手里。
把产品照片变成 10 秒口型宣传片
先从一个具体任务开始:手头有一张产品照,想让它动成 10 秒短视频。
打开「视频工作室」,把产品照作为「起始帧」传上去。上传的刹那,模型列表会自动从 40+ 个文生视频模型,切到 60+ 个图生视频模型,比如 Kling I2V、Veo3 I2V、Wan I2V。
写一句提示词描述你想要的运镜,选个模型,点生成,几分钟后就能拿到一段可下载的成片。
第一次用,先把这三件事办了:
- 想装到本地:直接下桌面版,macOS 拖进应用程序文件夹、Windows 点安装、Linux 有 AppImage 和 .deb,不用装 Node.js。
- 想省事:浏览器打开在线版,核心功能都在。
- 首次使用:进设置贴上你的 MuAPI API Key;只打算用本地模型的话,这步能跳过。
给现有视频重新配中文口型
换个场景:你有一段英文讲解视频,想改成中文口型。
「唇形同步工作室」专做这件事,内置 9 个口型模型,分两种模式:肖像图加音频,生成会说话的短视频;现有视频加音频,重新对口型。
选视频模式,传上原视频和中文音频,挑一个模型(比如 LTX 2.3 Lipsync),点生成。口型会跟着音频走,配音和本地化特别顺手。
用镜头参数调出电影质感
想要专业影视感,就进「电影工作室」,像调相机一样调画面。
选相机(模块化 8K 数字、全画幅电影机等),选镜头(创意倾斜、暖调电影原色、旋涡光斑人像),再定焦距(8mm 超广到 85mm 特写)和光圈(f/1.4 浅景深到 f/11 深焦)。
这些参数会被自动翻译成优化过的提示词修饰符,成片因此带上统一的电影色调,适合对画面有要求、需要连续镜头质感的创作者。
想批量跑任务、接入自己的流水线?
「工作流工作室」让你用拖拽把多个模型串起来:上一步的输出接到下一步,做出图、视频、配音这样的自动化流程,还能套模板、用 Playground 直接试跑。
要在自己的程序里调用,逻辑其实就两步:先 POST 把提示词和参数提交到模型端点,再轮询结果直到状态完成。这套两步模式封装在 src/lib/muapi.js,照着它就能对接任何后端。
所有模型集中在 packages/studio/src/models.js,加新模型或改参数,改这一处,桌面版和在线版同时生效。
想完全离线生成?
桌面版内置两套互不干扰的本地推理引擎,都在「设置 → 本地模型」里配置:
- sd.cpp(捆绑式):本机直接跑,Apple Silicon 走 Metal GPU,Linux/Windows 走 CUDA、Vulkan、ROCm,适合图像模型,Mac M 系可用。
- Wan2GP(自备服务器):在另一台带 CUDA 或 ROCm 显卡的机器上跑服务,桌面版只发提示词、收结果,适合 Wan 2.2、Hunyuan、LTX 这类视频模型。
硬件上最低 8GB 内存,Z-Image 这种大模型建议 16GB 起;8GB 的 M 系 Mac 稳妥起见只跑 SD 1.5。
想自托管整站:
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup && npm run electron:dev你可能会遇到
- 视频生成卡住或失败:先确认网络正常、API Key 贴对了,再把分辨率调低或换更轻量的模型。
- 本地推理慢:确认真的在走 GPU(Apple Silicon 应启用 Metal),而不是掉回 CPU;不行就降分辨率。
- 找不到之前生成的内容:所有生成记录都存在浏览器本地,历史面板里能回看、重新下载;上传过的图也留在本地,不会重复上传。
一条提示词、一张静图、一段录音,就是这个工具的全部原料。打开设置贴上你的 API Key,你的第一条口型视频 30 秒后就能出。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考