Duix.Avatar开源数字人本地部署:一段10秒视频,离线生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
先说结果:一段10秒的说话视频进去,出来的是一条"你"用自己的声音念任意稿子的口播视频,全程在你的电脑上离线完成。这就是 Duix.Avatar——一个支持数字人形象克隆、口播视频生成的开源 AI 工具,所有算力都在本机 GPU 上跑,素材、音频、模型文件不出机器。
下文按"装完长什么样 → 怎么跑通 → 能力拆解 → 谁适合 → 坑"的顺序讲,看完你手里应该有一份可以直接照做的清单。
装完之后的形态:3 个 Docker 服务 + 1 个桌面客户端
先明确"跑通"的判定标准:你的机器上会同时运行三个容器——fun-asr(语音识别)、fish-speech-ziming(语音合成)、duix.avatar(视频合成),再加上一个桌面上的 Duix.Avatar 客户端。客户端主页只有两个核心入口:右侧上传视频克隆一个数字人(形象 + 声音),左侧用已有模型创作视频,后面所有功能都围绕这两个动作展开。
5 步跑通本地部署
上手前先看硬件门槛,官方推荐配置是 i5-13400F / 32G 内存 / RTX 4070,系统要求 Windows 10 19042.1526 以上或 Ubuntu 22.04 Desktop。两个硬性条件:必须有英伟达显卡且装好驱动(本项目没有 NVIDIA 显卡三个服务根本起不来);磁盘要留足——Windows 上 D 盘空闲大于 30G 存模型和作品,C 盘大于 100G 存服务镜像。C 盘不够的话,装完 Docker 后可在 Docker Desktop 的 Settings → Resources → Advanced 里把磁盘镜像位置改到别的盘:
步骤本身不复杂:
- Windows 先确认 WSL:
wsl --list --verbose检查状态,没装就wsl --install,装完用wsl --update更新,再安装 Docker Desktop,首次启动接受协议并跳过登录; - 拉取项目代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar; - 进入
deploy目录(compose 文件都在 deploy/ 里),执行docker-compose up -d;只想要视频合成、不需要本地训练的话,用docker-compose -f docker-compose-lite.yml up -d,起来的服务只有Duix.Avatar-gen-video一个; - 等待。首次拉镜像约 70G 流量,半小时左右(看网速),建议连 WiFi;
- Docker 里看到上述三个服务都在运行,就算成功。
客户端不用自己编译,下载官方构建的安装包:Windows 双击Duix.Avatar-x.x.x-setup.exe安装,Ubuntu 双击 AppImage 即可(root 用户桌面下要加--no-sandbox参数运行)。Ubuntu 服务端用docker-compose-linux.yml,并且要先装好 nvidia-container-toolkit。
能力实测:输入什么,得到什么
一段10秒说话视频 → 你的数字分身
建模时最容易踩的细节是:上传的视频必须带真人说话的声音。程序会把视频拆成静音视频 + 音频两条线,静音视频负责克隆外貌,声音负责克隆音色。如果素材没有说话声,这一步会直接报错——这也是社区 issue 里出现频率最高的一类。模型建好后在"My Avatars"里能看到,后续创作直接选用。
一段文案 → 口播成片
最常用的路径:选模型、贴文案,系统先用克隆音色合成语音,再按音频驱动口型出片。文案支持中、英、日、韩、法、德、阿拉伯、西八种语言。如果你手里已有录好的音频,还可以跳过文字合成,直接上传音频驱动口型,语音里的节奏和语调会体现在画面表现上。
这两步也开放了 API:Docker 起来后语音合成在127.0.0.1:18180,视频合成提交和进度查询在127.0.0.1:8383,完整的请求参数和返回结构可以参考 src/main/service/ 下的 model.js、video.js、voice.js。想接到自己的批量生产流程里,这是官方给的入口。
这套东西适合谁
说直白点:你在意人脸和声音数据落在哪里,或者高频产出口播内容、不想按次计费,这套本地方案就值得折腾。反过来两种情况建议先别装——机器上没有英伟达显卡的,服务起不来,换配置也没用;只是想偶尔做一两条视频的,为 70G 镜像和 100G 磁盘付出的时间成本可能比收益高。另外显卡是 50 系列的用户,要改用docker-compose-5090.yml(基于 torch 预览版本,30/40 系列开 CUDA 12.8 也可用)。
社区高频踩坑:拉镜像失败、建模报错、日志在哪看
第一次跑的时候,问题基本集中在三处,按你遇到的先后排:
docker-compose up -d拉镜像报 connection 超时:Docker Hub 官方源不稳定,在 Docker 的 daemon.json 里加 registry-mirrors 国内镜像源,或走全局网络;- 新增模特报错:九成是素材视频里没有人在说话,重录带清晰人声的片段即可。其他报错先自查三个服务是否都是 Running 状态;
- 要贴日志:客户端从右上角菜单"Open Log"导出:
服务端则是点进对应 Docker 容器的 Logs 面板复制报错段,错误栈一般集中在请求处理的那几行:
更完整的自查流程和错误对照见 doc/常见问题.md。项目更新比较频繁,提问前建议先把服务端镜像和客户端都更新到最新版,不少问题已经被修掉了。
硬件核对没问题的话,就照上面的 5 步把服务跑起来,然后上传第一条 10 秒视频,看看效果再决定要不要深挖 API。项目地址:https://gitcode.com/GitHub_Trending/he/Duix-Avatar
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考