Open Generative AI 完整指南:AI 图像视频生成从入门到进阶
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
把一句文字描述变成一段 15 秒的动态视频,在很多平台要付每月几十美元的订阅费。Open Generative AI 把这件事做成免费开源的:它是一个可自托管的 AI 图像视频创作工作室,内置 400+ 模型,支持文本到图像、图像到视频与唇语同步,且没有内容过滤。
🎯 三句话看懂 Open Generative AI 能做什么
它用一个统一界面把图像、视频、电影特效和唇语同步打包在一起,所有模型都集中在 packages/studio/src/models.js 一个文件里维护,更多细节见 README。
三句话讲清它是什么
- 它是什么:一个免费、开源(MIT 协议)、可自托管的 AI 图像视频创作工作室,基于 Next.js 与 React 构建,覆盖14 个工作室和400+ 模型(
models.js清单实际已登记 500+ 个)。 - 解决什么问题:让创作者不必为 Midjourney、Runway 等订阅按月付费,也不受提示词被拦截或改写的限制;本地部署时数据不离开自己的机器。
- 和付费方案比省在哪:零订阅费、零使用上限。Midjourney 约 $10–$120/月、Runway 约 $12–$76/月,这部分钱直接省下,还能把界面换成自己的品牌。
🚀 按你的投入程度选上手路径
三条路径都能完成第一次生成,区别只在你愿意配多少环境。
轻用户:浏览器里直接生成
- 打开托管版页面,注册一个免费账户。
- 进入 Image 或 Video 工作室,选模型、填提示词、点 Generate。
- 结果自动存入本地生成历史,可一键下载原图。
💡提示:托管版默认走云端 API,模型总是最新的,适合不想配环境、只想快速出图出视频的人。
进阶用户:装桌面版并启用本地推理
- 从 Releases 下载对应平台安装包:macOS 用
.dmg(分 Apple Silicon / Intel),Windows 用.exe,Linux 用.AppImage或.deb。 - 打开应用后进入Settings → Local Models,一键安装 sd.cpp 引擎并下载模型。
- 在 Image Studio 点模型选择器旁的⚡ Local开关,即可本地生成,无需 API key。
开发者:从源码构建
- 前置准备 Node.js v18+(要用云端模型再备一个 Muapi.ai 接口密钥,只用本地模型可跳过)。
- 运行
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI,进入目录后执行npm run setup(它会自动npm install并构建 studio / workflow / agents 等 workspaces,只跑npm install是不够的)。 - 桌面版跑
npm run electron:dev;网页版跑npm run dev后访问localhost:3000。
🎬 按目标场景用核心能力
按"你想做成什么"找入口,不用纠结技术模块。
给一张产品图「动起来」
上传一张静态起始帧,选一个图像到视频模型,静态画面就变成 5/10/15 秒短视频。比如把一张电商主图生成背景缓缓流动的展示视频,或给插画里的雨加上飘动效果。
把文字直接变成图或视频
不传图就是文本到图像 / 文本到视频模式,填一句提示词即可。比如输入"清晨森林中的小木屋,阳光透过树叶洒下斑驳光影",选 Flux Dev 或 Nano Banana 2 出图;选 Kling、Veo 或 Wan 2.6 出视频。
让照片开口说话
Lip Sync Studio 用9 个专用模型覆盖两种输入:肖像图 + 音频 → 会说话的视频,或已有视频 + 音频 → 唇语同步视频。比如上传一张人物肖像和一段录音,生成口型对齐的讲解视频;或给外语视频配上本地语言的口型。
调出电影质感的镜头
Cinema Studio 把相机、镜头、焦距、光圈的选择转成优化过的提示词修饰符,焦距覆盖 8mm 超广角到 85mm 特写,光圈有 f/1.4 浅景深到 f/11 深景深。比如选 Premium Modern Prime 镜头 + f/1.4,就能让人物特写带上有质感的电影光斑。
三档硬件配置怎么选
本地推理只对桌面版开放,托管网页版一律走云端 API,所以这一节主要面向桌面版用户。
三档配置建议
| 档位 | 配置 | 能跑什么 | 说明 |
|---|---|---|---|
| 最低 | 8GB 内存 | SD 1.5 图像模型 | 8GB M 系列 Mac 跑 Z-Image 会卡死系统,只建议用 Dreamshaper 8 这类 2.1GB 的 SD 1.5 模型 |
| 推荐 | 16GB 内存 | Z-Image、SDXL、部分视频模型 | Z-Image 需要约 7.4GB 权重 + 2.4GB 计算缓冲,16GB 才稳 |
| 高端 | 16GB+ 内存 + 独立 GPU(CUDA/ROCm) | Flux、Wan 2.2、Hunyuan 等视频模型 | 视频大模型交给 Wan2GP 服务器,桌面端可以是任意设备(含 Mac) |
两个本地推理引擎
- sd.cpp(内置):基于 stable-diffusion.cpp 的 C++ 引擎,与 App 同机运行;Apple Silicon 走 Metal GPU 加速,Linux/Windows 走 CUDA/Vulkan/ROCm,适合纯图像模型,比如 Dreamshaper 8、Realistic Vision v5.1、SDXL Base 1.0。
- Wan2GP(自备服务器):HTTP 客户端连你自己跑的 Wan2GP 服务器(Python + PyTorch,需 CUDA/ROCm GPU),适合视频大模型,比如 Flux.1 Dev、Wan 2.2 T2V/I2V、Hunyuan Video、LTX Video。桌面端本身可以跑在 Mac 上,把推理甩给局域网里的 GPU 机器。
提示词、多参考图与工作流
把单次生成做成稳定产出,主要靠这三招。
提示词怎么写给对
- 写具体:把环境、光线、氛围写进去,比如"清晨森林中的小木屋,逆光,丁达尔效应"。
- 加风格词:带上油画、水彩、赛博朋克等艺术风格词,模型会更贴合预期。
- 用负面提示:明确排除不想要的元素,比如"无文字、不模糊、避免多余肢体"。
- 按模型调参:支持的模型才显示质量/分辨率选择器,比如 Nano Banana 2 能选 1K/2K/4K,flux-schnell 则不显示。
多张参考图一次喂进去
兼容的编辑模型最多支持14 张参考图(Nano Banana 2 Edit),选择器带序号徽章、支持批量上传。比如做产品换背景时,把主图 + 3 张风格参考按顺序选中,系统会按你选择的顺序发给模型。
用工作流把多步串起来
Workflow Studio 提供模板、社区工作流和拖拽节点编辑器,把图像、视频、音频模型连成流水线。比如"文生图 → 图生视频 → 加配乐"三步连成一个工作流,之后用 Playground 一键跑完,也能直接通过 API 调用。
⚠️ 三个高频坑的现象与解法
macOS 首次打开被拦截
现象:双击应用提示"已损坏"或 Gatekeeper 阻止打开。原因:应用未经 Apple 公证(notarized)。解法:终端执行xattr -cr "/Applications/Open Generative AI.app",再右键点"打开"确认一次;或走"系统设置 → 隐私与安全性 → 仍要打开",只做一次。
8GB 内存跑 Z-Image 卡死
现象:选 Z-Image Turbo/Base 后系统假死、应用无响应。原因:Z-Image 权重约 7.4GB + 2.4GB 缓冲,8GB 基础内存装不下。解法:8GB M 系列 Mac 改用 Dreamshaper 8 等 SD 1.5 模型(约 2.1GB),想要 Z-Image 就升到 16GB。
源码启动报"找不到 pages 目录"
现象:npm run dev后 Next.js 报 "Couldn't find a 'pages' directory"。原因:没带 submodule 克隆,或没执行npm run setup,导致 workspaces 包缺失。解法:确保从含app/、package.json、next.config.mjs的仓库根目录运行,并重新npm run setup补齐packages/Vibe-Workflow等子模块。
适合"想免费、无内容过滤地出图出视频,并且愿意为隐私自己托管"的创作者,以及需要多张参考图、电影级镜头这类付费平台没细项的人。如果你手头有一台 16GB 的机器,现在就可以下载桌面版,从 SD 1.5 的 Dreamshaper 8 跑出第一张图。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考