从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个本地开源数字人项目:上传约 10 秒的说话视频,就能克隆形象和声音,之后输入文案或音频即可生成口型同步的播报视频。全流程在自己的机器上离线跑完,从装环境到出第一支成片,顺利的话半小时左右。
先跑起来
架构分两部分:Docker 服务端(ASR、TTS、视频合成三个模型服务)+ Electron 桌面客户端。所有算力在服务端,客户端只负责操作,所以部署顺序是「先服务端、后客户端」。
1. 拉代码,起服务端。Windows 需要先装 Docker Desktop(WSL2 后端);Ubuntu 22.04 直接装 Docker 即可:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deployUbuntu 缺依赖先执行:
sudo apt install docker.io docker-compose然后在 deploy 目录执行:
docker-compose up -d首次拉镜像约 70G,看网速半小时到一小时。Docker 里看到Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video三个服务全部 Running 就算服务端就绪。NVIDIA 50 系列显卡改用docker-compose -f docker-compose-5090.yml up -d;显存紧张、只想跑视频合成的,用 lite 版 compose 文件(单服务)。
2. 启动客户端。从项目 Releases 下载 Windows 安装包(.exe)或 Ubuntu 的 AppImage,双击即用,无需装环境。偏好源码构建的:装 Node.js 18,在仓库根目录npm install && npm run dev即可,客户端代码在 src/ 目录。
3. 产出第一个结果。客户端里两步:
- Create Avatar:上传一段 10 秒左右、人正在说话的带声音视频。服务端做音画分离、ASR 转写、声音建模,得到一个数字人模型;
- Create Video:选中该模型,输入播报文案,稍等几分钟即可导出成片,口型与语音自动对齐。
能做出什么
输入固定是「一个数字人模型 + 一段文案或音频」,输出是带口型的说话视频。几个实际用法:
- 电商商品口播:输入商品卖点文案 + 店主 10 秒片段,输出固定出镜人的商品介绍视频;换一版卖点,改文案重新生成就行,不用重录。
- 客服帮助中心:输入 FAQ 单条答案文本,输出数字人讲解视频,嵌进帮助页,新用户的完播率通常好于纯文字。
- 周报/内部公告:输入周报摘要,输出统一数字人形象的口播视频,适合要求「视频里要有真人感」又不想真人露面的内部分发。
原理扫一眼
整条链路四步:上传视频先被拆成无声视频 + 音频;音频进 ASR 服务(FunASR)得到参考文本,同时进 TTS 服务(fish-speech)完成声音克隆;生成时,TTS 先把文案合成语音,视频合成服务再按音频节奏驱动原视频口型逐帧变化,最后渲染成口型对齐的成片。三个服务都是本地 Docker 容器,数据不出机器,各接口的调用逻辑可以看 src/main/service/video.js。
调优与排错
最低配置要求
- 显卡是硬门槛:没有 NVIDIA 显卡或驱动没装好,三个服务起不来。推荐 RTX 4070 级别,8G 显存可用;
- 内存建议 32G 以上;硬盘空闲 100G+(镜像约 70G,再留空间存成片)。Windows 上 C 盘不够时,在 Docker Desktop 的 Settings → Resources → Advanced 里把 WSL 镜像目录改到其他盘。
参数建议
- 建模视频 10 秒足够:画面清晰、人在说话、环境音少,声音建模质量直接决定后续 TTS 相似度;
- 文案分段生成,每段 30~50 字比较稳,接口的 topP 0.7、temperature 0.7 等参数默认值即可;
- 5090 或 30/40 系列装 CUDA 12.8 的,统一走 5090 那份 compose 文件。
首次生成失败排查
docker-compose up -d报 registry-1.docker.io 连接超时:Docker Hub 官方源不稳定,在/etc/docker/daemon.json里配 registry-mirrors 指向国内镜像源,或开全局代理;- 创建模特报错:上传的视频必须有人说话且带声音,静音片段会在 ASR 环节直接失败;
- 服务反复重启、客户端报 Connection refused:先
nvidia-smi确认能输出显卡信息,再看三个服务是否都 Running,都正常的话按 doc/常见问题.md 的自查步骤走。
定位问题时最有用的是两份日志:客户端日志在应用内的日志入口查看,服务端日志直接打开对应 Docker 服务的 Logs 页,具体位置 doc/常见问题.md 里有配图。成片质量基本由建模视频决定,而重做一次只花几分钟——挑一段最清晰的 10 秒,拍完就够用了。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考