8G显存离线数字人:Duix.Avatar免费部署完整指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
当一段10秒的手机自拍变成由你本人形象口播的成片,这就是"开源数字人"工具的最短路径——Duix.Avatar:上传一段10秒视频克隆形象和声音,输入文案,本地模型合成口播视频,全程不联网。这篇文章给你3套部署方案、4个高频坑、一份硬件门槛清单,读完10分钟就能判断它适不适合你。
为什么不用付费版?三条判断定选型
这一节解决"值不值得花一个周末折腾"。
| 对比维度 | Duix.Avatar(本地开源) | 商业云SaaS(常见档位) | 定制3D数字人 |
|---|---|---|---|
| 硬件门槛 | 8G显存 + 32G内存(社区实测3060级可用) | 无需GPU,但产出受档位限制 | 24G以上显存的工作站 |
| 授权/制作成本 | 免费商用 | 约¥1万+/年或按条计费 | 前期投入高(官方README对比3D路线曾高达数十万美元) |
| 数据走向 | 素材与声纹留在本地磁盘 | 上传云端合成 | 依赖供应商 |
| 语言覆盖 | 8种语言(中英日韩法德阿西) | 看档位 | 一次开发,加语言贵 |
| 自定义程度 | 代码与compose文件全开放 | 仅开放接口参数 | 完全定制 |
我的判断是两条:⚠️英伟达显卡 + 32G内存是一票否决项——全部算力在本地,没GPU三个容器起不来,16G内存连ASR都可能起不动;全离线是必选项——相比云SaaS,素材和声纹不出机器,这才是选它的理由。每月只出几条片子,云档位更划算;日更或素材涉密,免费商用授权(用户量超10万或年营收1000万美元以上的企业需另签协议)就是底线优势。
技术透视:你传的数据到底怎么流
这一节解决"上传的素材去哪了"。服务端是三个Docker容器:fun-asr做语音识别、fish-speech做语音合成、duix.avatar做视频合成,分别监听本机10095 / 18180 / 8383端口;Electron客户端只是调用这些接口的壳。
客户端界面很直接:左侧作品列表,右侧模型列表,"Create Video"和"Create Avatar"两个入口。
最低配置清单(低于这条线,服务基本起不来):
- 英伟达显卡,显存8G起步(推荐RTX 4070),驱动装好且
nvidia-smi能识别 - 内存32G;16G可能导致ASR服务启动失败
- 磁盘:素材目录30G以上(默认
D:\duix_avatar_data),Docker镜像区100G以上(可迁移) - 系统:Windows 10 19042+或Ubuntu 22.04桌面版
- 网络:仅首次拉镜像需要,约70G流量、半小时左右;之后可断网使用
三类人,三种用法
这一节解决"装好之后到底怎么用"。
内容创作者(课程/口播短视频)
- 输入:10秒出镜口播视频(正面、光线充足、背景干净)
- 操作:客户端"Create Avatar"克隆形象与声音,再"Create Video"输入文案
- 输出:一条口型同步的MP4,日更一条没问题
"以前一节课要约一天棚,场地费比物料还贵;现在上午窗边拍一段,下午数字人就把成片念完了,一周三更毫无压力。"——一位在社区分享的课程UP主
企业运营(批量产品短视频)
- 输入:代言人形象10秒视频 + 一批产品口播脚本
- 操作:克隆一次代言人,按脚本列表批量提交合成
- 输出:30条以上形象统一的短视频,形象与口型不跑偏
"批量最省心:30个SKU各要一条讲解视频,数字人形象不变只换文案,一个下午全部收工。"——一位做消费电子的品牌运营
独立开发者(接入自有流水线)
- 输入:HTTP请求,三个服务全部在127.0.0.1
- 操作:依次调用声纹预处理
18180/v1/preprocess_and_tran、文案合成18180/v1/invoke、视频合成8383/easy/submit,示例代码在src/main/service/目录 - 输出:可编程控制的成片,批量与定时任务自己封装
"接口全在localhost,没有鉴权没有计费,我包了个批量脚本,一晚上渲染了50条。"——一位接入本地API的开发者
上手三条路:Windows一键 / Ubuntu / 50系显卡
这一节解决"从看到能跑差几步"。三条路都在deploy/目录启动,区别只是选哪份compose文件。
路线A:Windows一键(推荐首选)前提:Docker Desktop(WSL2)与英伟达驱动装好;C盘余量不足100G时,先到Docker设置 → Resources里把"Disk image location"改到空间更大的盘(下图)。
cd deploy docker-compose up -d首次拉镜像约30分钟;Docker里出现fun-asr / fish-speech / duix.avatar三个服务即成功。想更轻可改用-f docker-compose-lite.yml,只起一个视频合成容器。随后从官方Release下载Windows安装包双击安装。
路线B:Ubuntu 22.04轻量前提:装好docker.io与nvidia-container-toolkit(安装命令见README),nvidia-smi可见显卡。
cd deploy docker-compose -f docker-compose-linux.yml up -d客户端用Release里的AppImage,双击即运行免安装;root登录桌面时需追加--no-sandbox参数。
路线C:50系显卡加速面向RTX 5090用户(30/40系CUDA 12.8环境也可用),使用PyTorch官方预览版:
cd deploy docker-compose -f docker-compose-5090.yml up -d| 路线 | 首次启动 | 资源占用 | 适合谁 |
|---|---|---|---|
| Windows完整版 | 约30分钟(拉取70G镜像) | 100G磁盘 / 32G内存 | 主力内容生产机 |
| Ubuntu 22.04 | 约30分钟,镜像相同 | 同上 | Linux桌面/开发机 |
| 50系方案 | 约30分钟,镜像相同 | 同上,需较新驱动 | RTX 5090 / CUDA 12.8 |
📌 避坑手册:四个高频报错怎么自查
这一节解决"出错了先看哪里"。
Q1:docker-compose up -d超时,拉取镜像失败?A:Docker Hub官方源不稳定。打开Docker Desktop → Settings → Docker Engine,添加registry-mirrors(下图),Apply并重启。 验证:docker images | grep guiji2025,确认fun-asr / fish-speech / duix.avatar三个镜像都在本地。 如果还不行:部分镜像源会失效,换用最新可用源(README里有一组列表)重试。
Q2:克隆形象时报"Connection refused"?A:ASR服务(fun-asr容器)启动慢,服务端就绪但ASR未就绪,刚启动的头几分钟常见,等5分钟重试。 验证:docker ps确认三个容器均为Up状态。 如果还不行:16G内存可能起不了ASR,升级内存,或再等久一点重试。
Q3:新增模特时提示文件/声音无法识别?A:模特视频里必须有人说话——程序要用音轨做声音克隆,无声视频或纯空镜必然失败。 如果还不行:检查音频是否落在compose约定的目录(默认D:\duix_avatar_data\voice\data),以及face2face目录可写。
Q4:客户端报错,日志去哪里拿?A:客户端点右上角菜单"Open Log",或到%APPDATA%\heygem.ai\logs\main.log直接取文件;服务端在Docker Desktop点开各容器的Logs标签页复制关键行。 验证:日志加三容器状态截图,基本能分清是环境问题还是数据问题。
路线图一句话:社区分享的规划指向实时直播驱动与移动端轻量化版本,官方持续跟进50系显卡与Ubuntu兼容,具体以项目Release更新为准。
想动手的话,四份材料足够:
- 部署配置:deploy/ —— Windows完整/轻量、Linux、50系四份compose文件
- 常见问题与自查步骤:doc/常见问题.md
- 三个本地API的示例代码:src/main/service/
- 授权条款:LICENSE —— 免费商用,用户量超10万或年营收1000万美元以上需另签协议
如果这篇帮你少走了一小时弯路,收藏就好。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考