Open Generative AI 入门指南:免费 AI 图像生成与视频生成工作室如何本地部署
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个 MIT 协议的开源 AI 图像生成与视频生成工作室:同一个界面里接入了 Flux、Midjourney、Kling、Sora、Veo、Seedream 等 420+ 个模型,覆盖图生文、图生视频、口型同步、音频等 8 大类,不设置提示词拦截,界面可以自托管。适合三类人:想低成本体验 AI 创作、不想被月费绑定的个人;有数据或内容合规顾虑、想把界面放在自己机器上的小团队;想基于现成界面二次开发的工程师。需要提前知道的一点:使用云端模型需要 Muapi.ai 的 API key,应用本身免费,模型调用按该网关的规则计费。
快速上手:最短路径跑起来
前提只有两个:Node.js 18+,以及一个 Muapi.ai 访问密钥(如果只用本地推理可以跳过)。从源码启动的路径很短:
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setupnpm run setup会装依赖并构建工作室、工作流、代理这几个 workspace 包,这一步不能省,只做npm install是跑不起来的。然后按目的二选一:
npm run dev # Web 版(Next.js),访问 http://localhost:3000 npm run electron:dev # 桌面端(Electron),带本地推理能力第一次生成时会弹出 API key 输入框。README 里提醒过:克隆必须带--recurse-submodules,否则工作流和代理两个子包是空的,开发脚本会直接报错。不想折腾环境的人,可以直接从仓库 Releases 页下载桌面安装包(macOS 的 dmg、Windows 的 exe、Ubuntu 的 AppImage/.deb),完全不需要 Node.js。
核心能力按使用场景看
出图与改图
Image Studio 是双模式的:不带参考图时列出 70+ 个文生图模型;上传一张参考图后,模型列表自动换成 75 个左右的图生图模型(编辑、放大、抠背景等),不用手动切换。界面里的画幅、分辨率、质量选项也是跟着模型能力动态显示的,不支持的选项直接隐藏。
一个比较实用的细节是多图输入:Nano Banana 2 Edit 这类编辑模型一次最多接收 14 张参考图,选择器里会标顺序号,图片按你勾选的顺序发给模型。另外,所有上传过的参考图会留在本地的上传历史里,之后直接点缩略图复用,不用反复传同一个文件。
做视频
Video Studio 沿用同一套切换逻辑:默认是 85+ 个文生视频模型,上传首帧图片后切到 120+ 个图生视频模型。近期加入的几组型号值得单独看一眼:
| 模型 | 要点 |
|---|---|
| Seedance 2.0(字节) | 5 / 10 / 15 秒三档时长,另有 Extend 模型可无缝续写 |
| Grok Imagine(xAI) | 6 / 10 / 15 秒,fun / normal / spicy 三种风格档 |
| MiniMax Hailuo 02 / 2.3 | 全高清输出,多个画幅,含快速版 |
| Kling v3 / Sora 2 / Veo 3 / Runway Gen-3 | 主流闭源模型的 API 入口 |
如果追求镜头质感,Cinema Studio 把虚拟相机参数做成了显式控件:焦距 8mm 到 85mm、光圈 f/1.4 到 f/11,外加 70mm 胶片、16mm 复古、变形宽银幕等镜头预设,选择会转成提示词修饰词。下面是它可模拟的 16mm 胶片质感:
让照片开口说话
Lip Sync Studio 提供 9 个口型同步模型,分两种用法:
- 肖像图 + 音频 → 说话视频:Infinite Talk、Wan 2.2 Speech to Video 输出 480p / 720p;LTX 2.3 和 LTX 2 19B 最高到 1080p。
- 已有视频 + 音频 → 重新对口型:Sync、LatentSync、Creatify、Veed、Infinite Talk V2V。
生成任务支持轮询恢复,刷新页面后未完成的作业会自动继续。
批量与自动化
Workflow Studio 用节点编辑器把图像、视频、音频模型串成流水线,有预置模板(图像链、视频管道等)和可浏览的社区工作流,保存后的流程还能通过 API 直接调用。Agent Studio 则是对话式的多轮代理,你描述目标,它规划并执行生成步骤。这两个功能来自 packages/Vibe-Workflow/ 和 packages/Open-Poe-AI/ 两个子模块,单独看会理解很多设计取舍。
部署方式与本地推理
三种运行方式各适合不同场景:
| 方式 | 命令 / 动作 | 特点 |
|---|---|---|
| Web 自托管 | npm run dev开发;npm run build && npm run start生产 | 数据不经过你自己的服务器之外的地方,但云端模型仍走 Muapi 网关 |
| 桌面端 | 下载安装包,或npm run electron:dev | 唯一支持本地推理的形态 |
| Docker | 仓库自带 Dockerfile 和 docker-compose.yml | docker compose up即可,端口映射 3001 → 3000,镜像基于 node:20-alpine |
桌面端内置两套互相独立的本地推理引擎,都在「设置 → 本地模型」里配置:
- sd.cpp(随应用捆绑):stable-diffusion.cpp 的 C++ 引擎,Apple Silicon 走 Metal 加速,Linux / Windows 走 CUDA / Vulkan / ROCm,也可以纯 CPU 跑。可用模型里最轻的是 Dreamshaper 8、Realistic Vision v5.1、Anything v5 这三个 SD 1.5 模型(各约 2.1 GB);SDXL Base 1.0 约 6.9 GB;Z-Image Turbo / Base 是 DiT 架构,质量上限更高但内存占用大。
- Wan2GP(自备服务器):应用本身只是 HTTP 客户端,你在任意一台有 CUDA / ROCm GPU 的机器上跑 Wan2GP 的 Gradio 服务,把地址填进设置即可。这条路能用到 Flux.1 Dev、Qwen Image、Wan 2.2、Hunyuan Video、LTX Video。它存在的原因是 Wan2GP 的推理运行时只有 CUDA 路径,没有 Apple Silicon 版本,所以官方把它设计成"Mac 上开着界面、隔壁 GPU 机器干活"的分工。
局限与注意事项
README 和配置里写明的限制,比宣传页重要,挑几条会实际碰到:
- 8GB 内存机器别碰 Z-Image。官方明确写着:8GB 的 M 系列 Mac 上跑 Z-Image 已知会卡死整机,这种机器请留在 SD 1.5 模型;Z-Image 建议 16GB 起步(权重 7.4GB 加约 2.4GB 计算缓冲)。
- 本地推理仅限桌面端。浏览器版和 Docker 版全部走云端 API。
- 云端模型 = 依赖 Muapi.ai 网关。应用开源免费,但生成调用要 API key,计费规则以网关为准;API key 存在浏览器 localStorage 里,不会发往 Muapi 以外的地方。
- 安装包没有平台签名。macOS 未公证,首次打开要用
xattr -cr或在"隐私与安全性"里放行;Windows 会触发 SmartScreen;Ubuntu 24.04+ 因为 AppArmor 限制用户命名空间,官方建议装 .deb 包(自带 AppArmor profile)而不是 AppImage。 - 子模块是硬依赖。不带
--recurse-submodules克隆,npm run dev会报找不到页面的错误。
小结与获取方式
一句话概括:Open Generative AI 是一个把 420+ 个生成模型塞进同一套界面的开源工作室,价值在于"自选模型 + 可自托管 + 本地推理可选项",代价是云端生成依赖 Muapi.ai 网关、本地推理有明确的硬件门槛。下一步建议先下载桌面端装个 2.1GB 的 SD 1.5 模型跑通一次本地生成,确认硬件没问题,再按需求开通 API key 试云端模型;想深入改界面,直接看 packages/studio/ 里的组件和 packages/studio/src/models.js 这份模型清单。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考