news 2026/9/19 15:51:59

不订阅、不审查、可本地跑:聚合 420+ 模型的开源 AI 图像/视频生成工作室深度解析

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
不订阅、不审查、可本地跑:聚合 420+ 模型的开源 AI 图像/视频生成工作室深度解析

不订阅、不审查、可本地跑:聚合 420+ 模型的开源 AI 图像/视频生成工作室深度解析

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

你有没有在某个 AI 平台提交 prompt,换回的却是"请调整措辞"?Open Generative AI 是一个面向自托管的开源 AI 图像/视频生成工作室:420+ 个主流模型(Flux、Midjourney、Kling、Sora、Veo、Seedream、Wan 2.2 等)通过统一 API 网关接入,不做内容过滤,不拦截提示词,MIT 协议。同一套代码提供 Next.js Web 版和 Electron 桌面版两种入口,桌面版还内置了两套本地推理引擎——最后这点是最有辨识度的地方,咱们逐层拆开看。

当 prompt 被平台"改写"

商业图像/视频平台几乎都按月订阅收费,背后还挂着一整套护栏:提示词可能被拦下,甚至被静默改写。这个项目的态度非常直接——所谓 Unrestricted,落到产品层面就是一件事:它不替你做"该不该生成"的判断,你的 prompt 原样进入模型。

随附的还有三个承诺:

  • 免费开源:MIT 协议,无订阅、无供应商锁定,代码可改可二次利用;
  • 可自托管:Web 版完整跑在你自己的机器上,数据不出门;
  • 统一网关:400 多个模型共用同一套"提交—轮询"接口,不用逐个对接厂商 SDK。

底层网关是 Muapi.ai,所以整个项目本质上是"一个可自由改写的工作室界面 + 一层模型能力聚合"。

🎥 16 个 Studio,按能力域划分

打开应用,左侧导航把 16 个工作室分成 Images、Video、Audio、Agents & Automation 四组(定义在components/StandaloneShell.jsTABS数组里)。逐个念名字意义不大,按能力域看能干什么更实用:

图像线(5 个页签):Image Studio 是主战场,双模式自动切换——没传参考图时是文生图(Flux、Nano Banana 2、Seedream 5.0、Midjourney 等 50+ 模型),拖入参考图的瞬间整体切到图生图(Kontext、Nano Banana 2 Edit、Seedream Edit、Upscaler 等 55+ 模型)。有个细节值得留意:选中支持多图输入的模型后,上传入口会变成多选,一次最多传 14 张参考图(Nano Banana 2 Edit 的天花板),选择顺序会按序传给模型。Layers、Cinema、Design Agent、AI Influencer 分别负责分层编辑、电影感镜头、画布式设计代理和虚拟人管理。

视频线(7 个页签):Video Studio 同样是 t2v / i2v 双模式(40+/60+ 模型);AI Clipping 从长视频里自动抽高光;Vibe Motion 做风格化动效;Lip Sync Studio 有 9 个专用模型、两种模式——人像 + 音频 → 说话视频(Infinite Talk、Wan 2.2 Speech to Video、LTX 2.3 / 2 19B Lipsync,分辨率 480p 到 1080p),既有视频 + 音频 → 唇形同步视频(Sync、LatentSync、Creatify、Veed、Infinite Talk V2V);Body Swap(Recast)做主体外观重铸;Marketing Studio 从单条输入吐出一整套广告创意变体。

音频线(1 个页签):文本驱动的音乐/音频生成与编辑。

自动化线(2 个页签):Agent Studio 是会规划并执行生成任务的多轮创意代理;Workflow Studio 是节点式可视化流水线编辑器——预置模板起步、拖拽模型连接步骤、Playground 表单里交互运行,每条工作流还能通过 API 调用。另有 Explore Apps 入口聚合基于同一模型目录的应用模板。

全局能力同样实用:所有传过的图都进 Upload History(localStorage里存 URL + 缩略图,跨会话复用,不用重复上传);宽高比、分辨率、时长这些参数按模型能力动态显示(Smart Controls);生成历史可浏览、可重下;任务完成时弹全局通知(12 秒 TTL、最多 3 条,切换工作室也不丢)。

Cinema Studio 单独说两句:6 台虚拟相机(从 Modular 8K Digital 到 70mm 胶片)、11 支镜头、6 档焦距(8mm–85mm)、3 档光圈(f/1.4–f/11),你选的每个参数都会被转成优化过的提示词修饰符。

420+ 模型,一张类目表就够

全部模型定义集中在packages/studio/src/models.js——一个 3 万多行的单文件,是整个项目的单一事实来源。在这里加一个模型,自托管版和托管版会同时生效。按 8 个类目盘一下:

类目规模代表模型
文生图70+Flux Dev、Nano Banana 2、Seedream 5.0、Ideogram v3、Midjourney v7
图生图70+Nano Banana 2 Edit(×14 图)、Flux Kontext Pro、Seededit v3
文生视频85+Kling v3、Sora 2、Veo 3、Seedance 2.0、Runway Gen-3
图生视频120+Kling I2V、Veo3 I2V、Seedance 2.0 I2V、Wan 2.2 I2V
视频转视频35+视频特效、AI Clipping、Vibe Motion
唇形同步15Infinite Talk、LTX 2.3/19B、LatentSync
主体重铸3图像/视频外观重铸
音频15+文生音乐、remix、音频编辑

近期值得留意的几个新模型:Nano Banana 2(Gemini 3.1 Flash Image,1K/2K/4K,宽高比支持 auto)、Seedream 5.0(最高 4K)、Seedance 2.0 Extend(在既有生成结果上续接,风格、运动、音频都保留)、Grok Imagine(6/10/15 秒,fun/normal/spicy 三种模式)。

⚡ 最值得折腾的部分:桌面版内置两套本地推理引擎

这是该项目和纯 Web 套壳工具拉开差距的地方:桌面版内置两套互相独立的本地引擎,共用 Settings → Local Models 界面和同一套生成 UI。Web 版没有这块——托管版只走云端 API。

sd.cpp(内置)Wan2GP(自带服务器)
形态stable-diffusion.cpp 的 C++ 引擎,与 App 同机运行指向你自己跑的 Gradio 服务器的 HTTP 客户端,桌面端只发提示词、收结果
算力Apple Silicon 走 Metal;Linux/Windows 走 CUDA/Vulkan/ROCm,CPU 也能跑服务器必须有 CUDA/ROCm GPU(Python + PyTorch)
能跑什么图像模型:SD 1.5、SDXL、Z-Image视频(Wan 2.2、Hunyuan、LTX)+ 大型图像模型(Flux、Qwen-Image)
典型用法M 系列 Mac 上离线出图Mac 当纯 UI,把推理甩给局域网 GPU 机器或租来的 RunPod/vast.ai

sd.cpp 这条线:目录(electron/lib/modelCatalog.js)里收了 6 个模型,全部公开可下载——Z-Image Turbo(2.5GB,8 步 turbo)、Z-Image Base(3.5GB,50 步)、Dreamshaper 8 / Realistic Vision v5.1 / Anything v5(SD 1.5 系,各约 2.1GB)、SDXL Base 1.0(6.9GB,30 步、dpmpp2m 采样)。两个 Z-Image 模型还要共享两个辅助文件:Qwen3-4B 文本编码器(2.4GB)加 FLUX VAE(335MB),只下一次。流程是:一键装引擎 → 下模型 → Image Studio 里点模型选择器旁的 ⚡ Local 开关 → 生成,全程不碰 API Key。所有下载都落在应用数据目录的bin/models/tmp/里,不往系统装任何东西;想把几十 GB 的权重挪到别的盘,启动前把OPEN_GENERATIVE_AI_LOCAL_AI_DIR指过去即可。

硬件坑提前说两个:8GB 基础款 M 系列 Mac 跑 Z-Image 是已知的系统挂起场景(权重加计算缓冲要 10GB 上下,官方建议 16GB),老老实实用 SD 1.5;SD 1.5 在 M2 上 Metal dylib 生效时普遍 1–2 秒/步,若你实测 10 秒/步,说明二进制回退到了 CPU。项目自带了一个健康检查思路——sd-cli就是应用实际调用的那个二进制,绕开 UI 直接验证:

APP_DATA="$HOME/Library/Application Support/open-generative-ai/local-ai" DYLD_LIBRARY_PATH="$APP_DATA/bin" "$APP_DATA/bin/sd-cli" \ -m "$APP_DATA/models/DreamShaper_8_pruned.safetensors" \ -p "a serene mountain lake at sunrise" \ -o /tmp/sd15-test.png \ --steps 12 -H 512 -W 512 --cfg-scale 7.5 --seed 42

Apple Silicon 正常跑会打印VRAM 1969.78MB(Metal 后端);打印VRAM 0.00MB则是 CPU 版,用otool -L "$APP_DATA/bin/libstable-diffusion.dylib" | grep -i metal确认,缺 Metal 就在 Settings → Local Models 重装引擎。

Wan2GP 这条线:应用不打包 Python 也不打包权重。你先在一台 GPU 机器上把 Wan2GP 跑起来(clone 这个开源项目、执行install.sh,再python wgp.py --listen --server-name 0.0.0.0绑定所有网卡),回桌面版 Settings 里粘 URL,Test 一下、Save,它的 5 个模型(Flux.1 Dev 28 步、Qwen Image 30 步、Wan 2.2 T2V/I2V、Hunyuan Video、LTX Video)就会出现在工作室里。为什么非要独立服务器?因为 Wan2GP 的运行时(Sage attention、flash-attn、AWQ/GGUF 内核)只有 CUDA 路径,没有 MPS,Mac 用户只能当客户端用。代码里还处理了一个很脏的现实问题:Wan2GP 不同版本之间会重命名 Gradio 的api_name,Pinokio 打包版甚至缺端点——所以连接时它会拉取服务器/info,把目录里每个模型的fn重映射成服务器实际注册的名字,fnAliases匹配新旧变体,family做最后的模糊匹配兜底(electron/lib/wan2gpProvider.js里的resolveFnNames())。

🚀 落地实操:四条路径

源码路线(面向贡献者,需 Node.js 18+,准备一个 Muapi access key;只用本地模型可跳过):

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup # 拉子模块 + 装依赖 + 构建 4 个 workspace 子包 npm run electron:dev # 桌面版(Electron + Vite) # 或者 npm run dev # Web 版 → http://localhost:3000

两个细节:--recurse-submodules不能省,workflow 和 agent 子包就放在子模块里;光npm install不够,setup会先把 workspace 包构建掉。如果报Couldn't find a 'pages' directory,说明你不在仓库根目录跑命令,或者子模块没拉全——回到根目录重跑npm run setup

桌面安装包路线:macOS 包没经 Apple 公证,首启会被 Gatekeeper 拦——执行xattr -cr "/Applications/Open Generative AI.app"再右键 Open 两次即可,做一次管终身;Windows SmartScreen 告警点 More info → Run anyway;Ubuntu 建议直接装.deb(自带 AppArmor profile),AppImage 在老系统上缺libfuse2。Ubuntu 24.04+ 还有专属坑:内核的apparmor_restrict_unprivileged_userns策略会卡住 Chromium 沙箱,AppImage 表现为静默起不来,换 .deb 或临时执行sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns=0(写进/etc/sysctl.d/可持久化)。

Docker 路线docker-compose.yml把宿主 3001 端口映射到容器内 3000,production 模式加自动重启;Dockerfile 是多阶段构建,最终镜像只带.next和运行依赖,不装开发工具链。

托管版路线:官方还提供免安装的托管版,浏览器打开即用——但本地推理只属于桌面版,别期待托管版有 sd.cpp。

🛠️ 架构内幕:monorepo、BYOK 与两步式 API

技术栈是 Next.js 15 + React 19 + Tailwind v3,用 npm workspaces 管 4 个子包(studioworkflow-builderai-agentdesign-agent)。根路由直接重定向到/studioStandaloneShell是壳层,根据 URL slug 决定激活哪个 Tab,Tab 间切换走window.history.pushState,不刷新页面。

API Key 管理是教科书式的 BYOK 实现,细节值得抄:密钥存localStorage(key 名muapi_key),同时写一个一年有效的SameSite=Laxcookie 给后台请求建立身份;Axios 请求拦截器对相对路径和五类内部代理路径(/api/app/api/workflow/api/agents/api/api/api/v1)注入x-api-key头,密钥不会漏给 S3 之类的外部域名;余额每 30 秒轮询一次;退出登录时存储与 cookie 一并清掉。

与模型网关的通信是"提交—轮询"两步式:先POST /api/v1/{model-endpoint}提交任务,再GET /api/v1/predictions/{request_id}/result轮询到completed。文件上传走POST /api/v1/upload_file(multipart)换回托管 URL,多图模型把完整的images_list数组塞进单次请求,唇形同步任务由专门的processLipSync()处理image_url/video_urlaudio_url的组合。仓库里app/api/目录是一组代理路由,把前端请求转发给网关,cleanHeaders()会剥掉host/connection/cookie等敏感头——源码注释里明确标了两处安全修复:移除 cookie 鉴权(CWE-522)、移除凭据日志(CWE-200)。

从哪开始动手

想加模型,打开packages/studio/src/models.js;想改工作室 UI,进packages/studio/src/components/;想研究 Electron 里如何集成两种异构本地引擎(一个内置 C++ 二进制、一个远程 Gradio 客户端),看electron/lib/;想复刻"Next.js 安全代理第三方 API"这套模式,直接抄app/api/。MIT 协议意味着你可以把它整包拿去做自己的产品外壳——从三万行的模型文件到 456 行的 Wan2GP 适配器,每一层都能读、能改,这份自由度大概就是"unrestricted"最先指的东西。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 15:51:10

一文上手 WinUI 3:从源码构建到跑通第一个 Windows 桌面应用

一文上手 WinUI 3:从源码构建到跑通第一个 Windows 桌面应用 【免费下载链接】microsoft-ui-xaml WinUI: a modern UI framework with a rich set of controls and styles to build dynamic and high-performing Windows applications. 项目地址: https://gitcode…

作者头像 李华
网站建设 2026/9/19 15:48:25

DeepSeek在银行智能投顾中的落地:从用户画像到动态资产配置

简介:本资源是以DeepSeek技术为核心的银行智能投顾个性化服务方案,共计227页,分为53个大章节,主要面向金融科技算法工程师、银行数字化产品经理及智能投顾研究者,解决动态资产配置、投资组合优化与投顾场景落地之间的衔…

作者头像 李华
网站建设 2026/9/19 15:47:51

AI训练数据集构建与使用规范:从采集校验到加载接口的工程化实践

简介:本资源是一份面向AI算法工程师、数据科学家及高校研究者的专业规范文档,系统梳理人工智能训练数据集从构建到使用的全流程标准与实践方法。内容覆盖数据集设计原则(目标明确性、多样性与可扩展性)、采集与质量控制、清洗/特征…

作者头像 李华
网站建设 2026/9/19 15:46:59

银河麒麟V11下KVM GPU直通实战:GT 710直通Win10虚拟机

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华