不订阅、不审查、可本地跑:聚合 420+ 模型的开源 AI 图像/视频生成工作室深度解析
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
你有没有在某个 AI 平台提交 prompt,换回的却是"请调整措辞"?Open Generative AI 是一个面向自托管的开源 AI 图像/视频生成工作室:420+ 个主流模型(Flux、Midjourney、Kling、Sora、Veo、Seedream、Wan 2.2 等)通过统一 API 网关接入,不做内容过滤,不拦截提示词,MIT 协议。同一套代码提供 Next.js Web 版和 Electron 桌面版两种入口,桌面版还内置了两套本地推理引擎——最后这点是最有辨识度的地方,咱们逐层拆开看。
当 prompt 被平台"改写"
商业图像/视频平台几乎都按月订阅收费,背后还挂着一整套护栏:提示词可能被拦下,甚至被静默改写。这个项目的态度非常直接——所谓 Unrestricted,落到产品层面就是一件事:它不替你做"该不该生成"的判断,你的 prompt 原样进入模型。
随附的还有三个承诺:
- 免费开源:MIT 协议,无订阅、无供应商锁定,代码可改可二次利用;
- 可自托管:Web 版完整跑在你自己的机器上,数据不出门;
- 统一网关:400 多个模型共用同一套"提交—轮询"接口,不用逐个对接厂商 SDK。
底层网关是 Muapi.ai,所以整个项目本质上是"一个可自由改写的工作室界面 + 一层模型能力聚合"。
🎥 16 个 Studio,按能力域划分
打开应用,左侧导航把 16 个工作室分成 Images、Video、Audio、Agents & Automation 四组(定义在components/StandaloneShell.js的TABS数组里)。逐个念名字意义不大,按能力域看能干什么更实用:
图像线(5 个页签):Image Studio 是主战场,双模式自动切换——没传参考图时是文生图(Flux、Nano Banana 2、Seedream 5.0、Midjourney 等 50+ 模型),拖入参考图的瞬间整体切到图生图(Kontext、Nano Banana 2 Edit、Seedream Edit、Upscaler 等 55+ 模型)。有个细节值得留意:选中支持多图输入的模型后,上传入口会变成多选,一次最多传 14 张参考图(Nano Banana 2 Edit 的天花板),选择顺序会按序传给模型。Layers、Cinema、Design Agent、AI Influencer 分别负责分层编辑、电影感镜头、画布式设计代理和虚拟人管理。
视频线(7 个页签):Video Studio 同样是 t2v / i2v 双模式(40+/60+ 模型);AI Clipping 从长视频里自动抽高光;Vibe Motion 做风格化动效;Lip Sync Studio 有 9 个专用模型、两种模式——人像 + 音频 → 说话视频(Infinite Talk、Wan 2.2 Speech to Video、LTX 2.3 / 2 19B Lipsync,分辨率 480p 到 1080p),既有视频 + 音频 → 唇形同步视频(Sync、LatentSync、Creatify、Veed、Infinite Talk V2V);Body Swap(Recast)做主体外观重铸;Marketing Studio 从单条输入吐出一整套广告创意变体。
音频线(1 个页签):文本驱动的音乐/音频生成与编辑。
自动化线(2 个页签):Agent Studio 是会规划并执行生成任务的多轮创意代理;Workflow Studio 是节点式可视化流水线编辑器——预置模板起步、拖拽模型连接步骤、Playground 表单里交互运行,每条工作流还能通过 API 调用。另有 Explore Apps 入口聚合基于同一模型目录的应用模板。
全局能力同样实用:所有传过的图都进 Upload History(localStorage里存 URL + 缩略图,跨会话复用,不用重复上传);宽高比、分辨率、时长这些参数按模型能力动态显示(Smart Controls);生成历史可浏览、可重下;任务完成时弹全局通知(12 秒 TTL、最多 3 条,切换工作室也不丢)。
Cinema Studio 单独说两句:6 台虚拟相机(从 Modular 8K Digital 到 70mm 胶片)、11 支镜头、6 档焦距(8mm–85mm)、3 档光圈(f/1.4–f/11),你选的每个参数都会被转成优化过的提示词修饰符。
420+ 模型,一张类目表就够
全部模型定义集中在packages/studio/src/models.js——一个 3 万多行的单文件,是整个项目的单一事实来源。在这里加一个模型,自托管版和托管版会同时生效。按 8 个类目盘一下:
| 类目 | 规模 | 代表模型 |
|---|---|---|
| 文生图 | 70+ | Flux Dev、Nano Banana 2、Seedream 5.0、Ideogram v3、Midjourney v7 |
| 图生图 | 70+ | Nano Banana 2 Edit(×14 图)、Flux Kontext Pro、Seededit v3 |
| 文生视频 | 85+ | Kling v3、Sora 2、Veo 3、Seedance 2.0、Runway Gen-3 |
| 图生视频 | 120+ | Kling I2V、Veo3 I2V、Seedance 2.0 I2V、Wan 2.2 I2V |
| 视频转视频 | 35+ | 视频特效、AI Clipping、Vibe Motion |
| 唇形同步 | 15 | Infinite Talk、LTX 2.3/19B、LatentSync |
| 主体重铸 | 3 | 图像/视频外观重铸 |
| 音频 | 15+ | 文生音乐、remix、音频编辑 |
近期值得留意的几个新模型:Nano Banana 2(Gemini 3.1 Flash Image,1K/2K/4K,宽高比支持 auto)、Seedream 5.0(最高 4K)、Seedance 2.0 Extend(在既有生成结果上续接,风格、运动、音频都保留)、Grok Imagine(6/10/15 秒,fun/normal/spicy 三种模式)。
⚡ 最值得折腾的部分:桌面版内置两套本地推理引擎
这是该项目和纯 Web 套壳工具拉开差距的地方:桌面版内置两套互相独立的本地引擎,共用 Settings → Local Models 界面和同一套生成 UI。Web 版没有这块——托管版只走云端 API。
| sd.cpp(内置) | Wan2GP(自带服务器) | |
|---|---|---|
| 形态 | stable-diffusion.cpp 的 C++ 引擎,与 App 同机运行 | 指向你自己跑的 Gradio 服务器的 HTTP 客户端,桌面端只发提示词、收结果 |
| 算力 | Apple Silicon 走 Metal;Linux/Windows 走 CUDA/Vulkan/ROCm,CPU 也能跑 | 服务器必须有 CUDA/ROCm GPU(Python + PyTorch) |
| 能跑什么 | 图像模型:SD 1.5、SDXL、Z-Image | 视频(Wan 2.2、Hunyuan、LTX)+ 大型图像模型(Flux、Qwen-Image) |
| 典型用法 | M 系列 Mac 上离线出图 | Mac 当纯 UI,把推理甩给局域网 GPU 机器或租来的 RunPod/vast.ai |
sd.cpp 这条线:目录(electron/lib/modelCatalog.js)里收了 6 个模型,全部公开可下载——Z-Image Turbo(2.5GB,8 步 turbo)、Z-Image Base(3.5GB,50 步)、Dreamshaper 8 / Realistic Vision v5.1 / Anything v5(SD 1.5 系,各约 2.1GB)、SDXL Base 1.0(6.9GB,30 步、dpmpp2m 采样)。两个 Z-Image 模型还要共享两个辅助文件:Qwen3-4B 文本编码器(2.4GB)加 FLUX VAE(335MB),只下一次。流程是:一键装引擎 → 下模型 → Image Studio 里点模型选择器旁的 ⚡ Local 开关 → 生成,全程不碰 API Key。所有下载都落在应用数据目录的bin/、models/、tmp/里,不往系统装任何东西;想把几十 GB 的权重挪到别的盘,启动前把OPEN_GENERATIVE_AI_LOCAL_AI_DIR指过去即可。
硬件坑提前说两个:8GB 基础款 M 系列 Mac 跑 Z-Image 是已知的系统挂起场景(权重加计算缓冲要 10GB 上下,官方建议 16GB),老老实实用 SD 1.5;SD 1.5 在 M2 上 Metal dylib 生效时普遍 1–2 秒/步,若你实测 10 秒/步,说明二进制回退到了 CPU。项目自带了一个健康检查思路——sd-cli就是应用实际调用的那个二进制,绕开 UI 直接验证:
APP_DATA="$HOME/Library/Application Support/open-generative-ai/local-ai" DYLD_LIBRARY_PATH="$APP_DATA/bin" "$APP_DATA/bin/sd-cli" \ -m "$APP_DATA/models/DreamShaper_8_pruned.safetensors" \ -p "a serene mountain lake at sunrise" \ -o /tmp/sd15-test.png \ --steps 12 -H 512 -W 512 --cfg-scale 7.5 --seed 42Apple Silicon 正常跑会打印VRAM 1969.78MB(Metal 后端);打印VRAM 0.00MB则是 CPU 版,用otool -L "$APP_DATA/bin/libstable-diffusion.dylib" | grep -i metal确认,缺 Metal 就在 Settings → Local Models 重装引擎。
Wan2GP 这条线:应用不打包 Python 也不打包权重。你先在一台 GPU 机器上把 Wan2GP 跑起来(clone 这个开源项目、执行install.sh,再python wgp.py --listen --server-name 0.0.0.0绑定所有网卡),回桌面版 Settings 里粘 URL,Test 一下、Save,它的 5 个模型(Flux.1 Dev 28 步、Qwen Image 30 步、Wan 2.2 T2V/I2V、Hunyuan Video、LTX Video)就会出现在工作室里。为什么非要独立服务器?因为 Wan2GP 的运行时(Sage attention、flash-attn、AWQ/GGUF 内核)只有 CUDA 路径,没有 MPS,Mac 用户只能当客户端用。代码里还处理了一个很脏的现实问题:Wan2GP 不同版本之间会重命名 Gradio 的api_name,Pinokio 打包版甚至缺端点——所以连接时它会拉取服务器/info,把目录里每个模型的fn重映射成服务器实际注册的名字,fnAliases匹配新旧变体,family做最后的模糊匹配兜底(electron/lib/wan2gpProvider.js里的resolveFnNames())。
🚀 落地实操:四条路径
源码路线(面向贡献者,需 Node.js 18+,准备一个 Muapi access key;只用本地模型可跳过):
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup # 拉子模块 + 装依赖 + 构建 4 个 workspace 子包 npm run electron:dev # 桌面版(Electron + Vite) # 或者 npm run dev # Web 版 → http://localhost:3000两个细节:--recurse-submodules不能省,workflow 和 agent 子包就放在子模块里;光npm install不够,setup会先把 workspace 包构建掉。如果报Couldn't find a 'pages' directory,说明你不在仓库根目录跑命令,或者子模块没拉全——回到根目录重跑npm run setup。
桌面安装包路线:macOS 包没经 Apple 公证,首启会被 Gatekeeper 拦——执行xattr -cr "/Applications/Open Generative AI.app"再右键 Open 两次即可,做一次管终身;Windows SmartScreen 告警点 More info → Run anyway;Ubuntu 建议直接装.deb(自带 AppArmor profile),AppImage 在老系统上缺libfuse2。Ubuntu 24.04+ 还有专属坑:内核的apparmor_restrict_unprivileged_userns策略会卡住 Chromium 沙箱,AppImage 表现为静默起不来,换 .deb 或临时执行sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns=0(写进/etc/sysctl.d/可持久化)。
Docker 路线:docker-compose.yml把宿主 3001 端口映射到容器内 3000,production 模式加自动重启;Dockerfile 是多阶段构建,最终镜像只带.next和运行依赖,不装开发工具链。
托管版路线:官方还提供免安装的托管版,浏览器打开即用——但本地推理只属于桌面版,别期待托管版有 sd.cpp。
🛠️ 架构内幕:monorepo、BYOK 与两步式 API
技术栈是 Next.js 15 + React 19 + Tailwind v3,用 npm workspaces 管 4 个子包(studio、workflow-builder、ai-agent、design-agent)。根路由直接重定向到/studio;StandaloneShell是壳层,根据 URL slug 决定激活哪个 Tab,Tab 间切换走window.history.pushState,不刷新页面。
API Key 管理是教科书式的 BYOK 实现,细节值得抄:密钥存localStorage(key 名muapi_key),同时写一个一年有效的SameSite=Laxcookie 给后台请求建立身份;Axios 请求拦截器只对相对路径和五类内部代理路径(/api/app、/api/workflow、/api/agents、/api/api、/api/v1)注入x-api-key头,密钥不会漏给 S3 之类的外部域名;余额每 30 秒轮询一次;退出登录时存储与 cookie 一并清掉。
与模型网关的通信是"提交—轮询"两步式:先POST /api/v1/{model-endpoint}提交任务,再GET /api/v1/predictions/{request_id}/result轮询到completed。文件上传走POST /api/v1/upload_file(multipart)换回托管 URL,多图模型把完整的images_list数组塞进单次请求,唇形同步任务由专门的processLipSync()处理image_url/video_url加audio_url的组合。仓库里app/api/目录是一组代理路由,把前端请求转发给网关,cleanHeaders()会剥掉host/connection/cookie等敏感头——源码注释里明确标了两处安全修复:移除 cookie 鉴权(CWE-522)、移除凭据日志(CWE-200)。
从哪开始动手
想加模型,打开packages/studio/src/models.js;想改工作室 UI,进packages/studio/src/components/;想研究 Electron 里如何集成两种异构本地引擎(一个内置 C++ 二进制、一个远程 Gradio 客户端),看electron/lib/;想复刻"Next.js 安全代理第三方 API"这套模式,直接抄app/api/。MIT 协议意味着你可以把它整包拿去做自己的产品外壳——从三万行的模型文件到 456 行的 Wan2GP 适配器,每一层都能读、能改,这份自由度大概就是"unrestricted"最先指的东西。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考