Open Generative AI:把提示词变成影视级视频与图像的开源生成工作室
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个可自托管的开源 AI 视频生成与图像创作平台,内置 400 余个模型,覆盖文生图、图生图、文生视频、图生视频和唇形同步,MIT 协议,无内容过滤器,没有订阅费用。
它解决的是什么问题
商业 AI 视频平台按月收费,提示词会被过滤或改写,模型由平台单方面决定你能用什么。而自部署一个模型又得自己搭训练和推理环境,门槛高且模型更新慢。
它用一个"模型目录 + 统一 API 网关"的方式解决这个问题:所有模型定义集中在 packages/studio/src/models.js 一个文件里维护,图像、视频、音频、工作流 14 个工作室共用同一套模型池和界面,你只负责写提示词。相比闭源订阅制平台,它把选择权和源码都交还给你——Midjourney、Runway 这类平台体验依旧流畅,只是不开放模型目录和二次开发。
核心功能拆解
写提示词出图,传参考图就自动切换编辑模式
图像工作室不让你手动选模式:不传参考图时,下拉框列出 70 多个文生图模型(Flux、Midjourney、Seedream 等);一旦上传参考图,模型集合自动换成 55 多个图生图模型,提示词从必填变为可选。做海报迭代、给同一主体换背景时,这个自动切换省掉一次来回选择。
一句话出视频,也可以让首帧动起来
视频工作室沿用同样的双模式设计:纯文本提示词走 40 多个文生视频模型(Kling、Sora、Veo、Wan 等),上传首帧图后切换到 60 多个图生视频模型。核心实现在 src/components/VideoStudio.js。需要一段有具体运动逻辑的镜头、或者把已有设计稿"动"起来时用得上。
让静止人像开口说话
唇形同步工作室支持 9 个专用模型、两种输入:人像照片 + 音频生成说话视频,或现有视频 + 音频替换口型。做配音、多语言版本、数字人口播时它是主力入口,生成历史单独保存,刷新页面后未完成的任务会自动续跑。
像调摄影机一样调镜头参数
电影工作室把相机型号、镜头、焦距、光圈做成了可视选项,比如 70mm 胶片机配 f/1.4 浅景深、85mm 人像焦段,这些选择会被翻译成优化后的提示词修饰符。想要"胶片感""电影感"但又说不清具体参数时,直接点预设即可。
拖节点串起多模型流水线
工作流工作室提供节点式可视化编辑器:把图像、视频、音频模型连成多步流水线,输出直接路由给下一个节点,还能浏览社区模板并在 Playground 里交互式运行。当你需要"图生图 → 图生视频 → 加配音"这种固定组合反复执行时,把它存成模板最划算。
从 0 到跑通:最短上手路径
| 入口 | 适合谁 | 操作步骤 |
|---|---|---|
| 桌面应用(Electron) | 想要本地推理的用户 | 从 Releases 下载对应平台安装包(macOS .dmg / Windows .exe / Linux AppImage 或 .deb),打开后进入设置页填入 MuAPI 密钥,即可开始生成 |
| Web 版(Next.js) | 只想先试试的用户 | npm run setup装依赖并构建工作区包,npm run dev启动,浏览器打开 http://localhost:3000 |
| 本地推理(仅桌面端) | 不想用云 API 的用户 | 设置 → Local Models 里一键安装 sd.cpp 引擎并下载模型,之后在图像工作室点 ⚡ Local 开关,无需任何密钥 |
macOS 首次打开若被 Gatekeeper 拦截,在终端执行一次xattr -cr "/Applications/Open Generative AI.app"后右键打开即可。
用好它的几个实战技巧
- 你会遇到生成质量不稳定,可以这样处理:把场景、主体、运动方向写全,并上传一张高质量参考图,让模型有明确依据。
- 你会遇到等待时间长,可以这样处理:视频生成本身耗时较长,轮询默认最长约 2 分钟(视频任务更长),别反复刷新;本地推理可换 LTX 这类快模型或降低分辨率。
- 你会遇到本地推理卡死,可以这样处理:Z-Image 系列需要 16GB 内存,8GB 的 Mac 上建议只用 SD 1.5 模型(约 2GB)。
- 你会遇到提示词和模型不匹配,可以这样处理:电影工作室里直接选镜头预设,比手写"cinematic"之类的泛词更可控。
延伸能力:集成、自动化与二次开发
- API 两步模式:先 POST 到模型端点提交任务,拿到 request_id 后轮询结果接口直到 completed,完整客户端封装在 src/lib/muapi.js,你可以照这个模式把生成能力接进自己的系统。
- 工作流串联:每个工作流同样可通过 API 调用,批量任务不用走界面。
- 二次开发:Next.js + npm workspaces 结构,模型目录、工作室组件都在 packages/studio 里,加模型或改界面直接改源码即可。
你大概率会问
Q: 不用 API 密钥能跑吗?A: 可以。桌面端装 sd.cpp 引擎并下载本地模型后,全程离线生成,不需要任何密钥。
Q: macOS 打开应用提示"已损坏"或无法验证开发者?A: 应用未做 Apple 公证。终端执行xattr -cr "/Applications/Open Generative AI.app",再右键打开一次即可。
Q: Linux 上 AppImage 打不开?A: 旧系统装libfuse2;Ubuntu 24.04 及以上受 AppArmor 限制,建议直接装 .deb 包,它自带相应配置。
Q: 上传的参考图要每次重传吗?A: 不用。所有上传过的图片保存在本地历史里,生成时从选择面板直接勾选即可,跨会话有效。
Q: 可以商用吗?A: 项目本身是 MIT 协议,允许商用、修改和分发;注意各接入的 AI 模型可能有自己的使用条款。
它适合想绕过订阅费和内容过滤、把模型选择权握在自己手里的创作者,也适合想基于现成工作室做二次开发的团队。下一步很简单:
- ✅ 400+ 模型、14 个工作室,MIT 开源
- ✅ 无内容过滤,提示词不被拦截
- ✅ 可自托管,数据留在本机
- ✅ 桌面端支持 sd.cpp / Wan2GP 本地推理
- ✅ 节点式工作流,可 API 调用
把仓库 clone 下来(git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI),跑一次npm run setup,大约 10 分钟就能看到第一个生成结果。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考