news 2026/9/4 12:06:58

Open Generative AI:免费开源的 AI 视频生成工作室,400+ 模型可自托管

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI:免费开源的 AI 视频生成工作室,400+ 模型可自托管

Open Generative AI:免费开源的 AI 视频生成工作室,400+ 模型可自托管

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个免费、开源的 AI 视频生成工作室(MIT 协议),接入 Flux、Midjourney、Kling、Sora、Veo 等 400+ 模型,支持文生视频、图生视频、唇形同步等生成方式,没有内容过滤器,可以完整自托管,数据留在自己的机器上。适合短视频创作者、影视爱好者和在意隐私的开发者。

快速上手

这一节能让你用最短时间跑起来一个可用的 Open Generative AI,按零安装到自托管从轻到重排了三种方式。

方式一:网页版,零安装。项目官方提供一个托管在线版本,浏览器打开就能用全部 14 个工作室(图像、视频、唇形同步、工作流等),注册免费账号即可开始生成。网页版走云端 API,对本地硬件没有任何要求,适合先体验再决定要不要部署。

方式二:桌面应用,推荐大多数人用。官方提供预构建安装包,不需要 Node.js 和终端:macOS 是 DMG(分 Intel 和 Apple Silicon 两个版本),Windows 是 x64 安装包,Linux 有 AppImage 和 .deb 两种。macOS 首次启动被 Gatekeeper 拦下时不用担心,应用只是没有做公证,去系统设置的「隐私与安全性」里点「仍要打开」就行,全程不用敲命令;Windows SmartScreen 弹窗点「更多信息 → 仍要运行」即可。

方式三:从源码构建。需要 Node.js 18+。先执行git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI(必须带子模块,工作流和智能体包都在子模块里),再执行npm run setup安装依赖并构建工作区子包,这一步不能省,只跑 npm install 是不够的。之后跑 npm run dev 启动网页版,浏览器访问 localhost:3000 就是完整应用。

首次使用只需要配一项:启动时会提示输入 Muapi API 密钥,粘贴到设置界面即可;如果只打算用本地模型,这一步可以直接跳过。密钥只保存在浏览器 localStorage 里,不会同步到其他服务器。

工作室生成页:输入场景描述、选择模型即可生成,顶部导航可切换 14 个不同工作室

核心功能讲解

这一节按你实际使用时的任务拆解功能,从生成到精修,每个功能先说适用场景再说具体操作。

从一句话生成视频

视频工作室是项目的主角,采用双模式自动切换:不上传图片时展示 40+ 个文生视频模型(Kling、Sora、Veo、Runway 等);上传一张起始帧图片后自动切换到 60+ 个图生视频模型。操作上就是输入提示词、选择画幅比例和时长、点生成,模型列表会随你有没有传图自动变,不用自己研究哪个模型能吃图片。核心实现在 src/components/VideoStudio.js。

用文字和参考图生成或精修图像

图像工作室同样是双模式:默认 50+ 个文生图模型,上传参考图后切换到 55+ 个图生图模型。两个细节比较实用:一是支持的模型最多一次喂 14 张参考图,勾选顺序就是发送给模型的顺序,适合做多角色合成或风格迁移;二是所有上传过的图都存进本地上传历史,下次用到同一个角色或素材直接从历史面板点选,不用重复上传。

图像生成页:选定模型、输入场景描述,生成完成后可一键下载原图

让人物口型跟着音频动

适合配音、多语言本地化和数字人场景。唇形同步工作室有 9 个专用模型、两种输入模式:一种是「人像图片 + 音频 → 说话视频」,另一种是「已有视频 + 音频 → 口型同步视频」。流程固定:选模式、传图或视频、传音频,可再写一句提示词引导动作风格,然后生成。任务列表单独保存,页面刷新后未完成的生成会自动接上。实现在 src/components/LipSyncStudio.js。

用相机参数拍出专业电影感

电影工作室把相机语言翻译成了生成参数:机身(从 70mm 胶片到 8K 数字电影机)、11 种镜头(变形、微距、移轴等)、焦距(8mm 超广角到 85mm 特写人像)、光圈(f/1.4 浅景深到 f/11 深焦)都可选。选完之后系统会自动把这些参数转成提示词修饰语拼进请求里,你不需要自己背「电影感提示词」怎么写。

Cinema Studio 中创意移轴镜头选项的示例图,共提供 11 种镜头风格

进阶与深挖

这一节覆盖三件事:在自己机器上跑模型、常见问题的排查、以及接入自己的系统。

配置本地推理省成本又保隐私

本地推理只在桌面应用里可用,内置两个独立引擎。一个是捆绑的 sd.cpp,直接跑在本机,支持 Apple Silicon 的 Metal GPU 以及 Linux/Windows 上的 CUDA、Vulkan、ROCm,模型列表有 Z-Image Turbo、SDXL、SD 1.5 系列等,全是图像模型;另一个是 Wan2GP,需要你在有 CUDA/ROCm GPU 的机器上自己跑一个 Gradio 服务器,桌面应用通过网络发请求——这意味着 Mac 用户也能远程借用局域网里一台带 NVIDIA/AMD 显卡的机器跑 Wan 2.2、Hunyuan、LTX 等视频模型和 Flux 等大图像模型。两个引擎都在「设置 → 本地模型」里配置:一键装引擎、下载模型,生成时点 Local 开关就能用,全程不需要 API 密钥。硬件上注意:跑 Z-Image 建议 16GB 内存,8GB 的 Mac 上已知会把系统卡死,这类机器请改用 SD 1.5 模型。

常见坑与解决

  • 网页版启动报「Couldn't find a pages directory」:说明没在仓库根目录运行,或子模块缺失。确认所在目录里有 app/ 和 next.config.mjs,然后重跑 npm run setup 即可。
  • macOS 首次打开被拦截:不是中病毒,应用只是未做公证。在「系统设置 → 隐私与安全性」点「仍要打开」,只需要做一次。
  • Ubuntu 24.04+ 上 AppImage 无响应或直接闪退:新内核的 AppArmor 策略限制了 Chromium 沙箱。直接改用 .deb 包,安装时会自动装好对应的 AppArmor 配置。
  • 本地生成慢得反常:Apple Silicon 上 SD 1.5 正常速度约 1–2 秒一步,如果到了 10 秒左右,说明引擎回退到了 CPU。去「设置 → 本地模型」重装一次引擎再验证。
  • 云端生成失败或超时:先确认网络与 API 密钥填的是密钥值而不是密钥名称,然后降低分辨率或换一个更轻的模型再试。

用 API 接入自己的模型与工作流

应用与 Muapi 之间是一个两步协议:第一步 POST 到模型端点提交任务,第二步轮询结果端点直到状态变为完成,密钥走 x-api-key 请求头。客户端实现见 src/lib/muapi.js,想接自己的后端或做自动化批处理,照这个模式写就行。工作流工作室本质上是这套 API 的可视化版本:拖拽节点编辑器把图像、视频、音频模型连成流水线,有现成模板可以套用,跑好的流程也能保存复用,而且每个流程本身都可以通过 API 调用,方便嵌进你自己的产品里;底层工作流引擎是独立的开源包,可以直接搬到其他项目中使用。

全部 400+ 模型的清单就定义在一个文件里(packages/studio/src/models.js),新增模型或改界面都比想象中简单。如果受够了商业平台的订阅费和提示词拦截,现在就可以 clone 仓库跑起来,先试着让一句提示词变成第一条视频。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 12:05:09

Java实战:基于Spring AI Alibaba Graph构建HR自动化AI Agent

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 12:04:33

软考多媒体设计师备考指南:从零基础到应试能力的系统方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 12:01:00

AI技能包实战指南:从环境配置到工作流集成的完整路径

1. 先搞清楚“AI技能包”到底能帮你解决什么实际问题 看到“顶级AI生产力”、“新手必备”这类标题,很多人的第一反应是兴奋,紧接着就是困惑:这到底是什么?是软件、模型、插件,还是教程合集?我花时间下载安…

作者头像 李华
网站建设 2026/9/4 11:58:25

RAG检索优化:Embedding微调解决知识库漏召回

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:58:04

让AI替你摆场景:BlenderMCP 3D建模从接入到实操

让AI替你摆场景:BlenderMCP 3D建模从接入到实操 【免费下载链接】blender-mcp Community plugin to control Blender 3D with any LLM of your choice 项目地址: https://gitcode.com/GitHub_Trending/bl/blender-mcp 凌晨两点,客户突然要求把整个…

作者头像 李华
网站建设 2026/9/4 11:57:40

答题PK对战怎么玩?组织一场在线对战答题活动的完整流程

先给结论答题PK对战指的是两名(或两组)参与者同时作答同一套题目,系统按正确率和用时实时判定胜负的一种竞赛玩法。它把"答题"从单向考核变成互动对抗,常用于社群活跃、课堂互动、企业团建和粉丝运营。借助问卷家这类支…

作者头像 李华