免费AI数字人本地部署:Duix.Avatar用10秒视频训练你的数字分身
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是免费开源的AI数字人工具:上传约10秒的真人说话视频,在本地克隆你的形象和声音,输入文案即可生成口播视频。适合不想把影像声音传上云端的教育者、内容创作者与企业培训人员。
项目速览:这款免费AI数字人工具能做什么
简单说,它把"录视频、克隆、配音、对口型"这套流程装进了一个桌面应用:你提供一段真人视频,它负责后续的 AI 数字人生成,全程不联网。
| 维度 | 说明 |
|---|---|
| 它做什么 | 克隆外貌+声音,文字/语音驱动,自动生成口型同步的口播视频 |
| 适合谁 | 无编程基础的个人创作者、教师、企业培训人员 |
| 是否离线 | 完全离线,数据和算力都在你自己的电脑上 |
| 部署成本 | 一次性下载约70G镜像,之后无授权费、无月费 |
主界面只有两个核心入口:左侧 Create Video 直接用数字分身做视频,右侧 Create Avatar 先训练一个分身。下面的 My Works / My Avatars 分别管理你的作品和已训练的模型。
上手前的门槛:本地部署数字分身的硬件与软件要求
先把话说在前面:这个项目的所有算力都在本地,必须有一张装了驱动的英伟达显卡,否则三个服务都起不来。
硬件要求
| 部件 | 要求 | 备注 |
|---|---|---|
| CPU | 13代 i5 起步(如 i5-13400F) | 官方推荐配置 |
| 内存 | 32GB 及以上 | 16GB 可能起不动 ASR 服务 |
| 显卡 | 英伟达显卡,推荐 RTX 4070 | 驱动装好后nvidia-smi能显示信息即可 |
| 硬盘 | 100GB 以上空闲 | Windows:C盘存镜像需 >100G,D盘存数据需 >30G |
软件环境
- 系统:Windows 10 19042.1526 及以上,或 Ubuntu 22.04 Desktop
- Docker:Windows 用 Docker Desktop(需先装 WSL),Ubuntu 用 apt 安装
- 英伟达显卡驱动:必装项,装完跑一下
nvidia-smi确认 - Node.js 18:仅当你要从源码自己构建客户端时才需要,直接用官方安装包可跳过
5分钟部署开源AI数字人:从克隆代码到服务跑起来
整个部署核心就两条命令,其余时间都花在下载镜像上。
第1步:装好 Docker 和显卡驱动
- Windows:先确认 WSL(
wsl --list --verbose,没装过就wsl --install再wsl --update),然后安装 Docker Desktop 并首次运行 - Ubuntu:
sudo apt update && sudo apt install docker.io docker-compose,再按官方流程装显卡驱动和 NVIDIA Container Toolkit - C盘空闲不足100G时,装完 Docker 可在设置里把镜像目录改到其他磁盘:
第2步:克隆项目代码
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar第3步:启动服务端
cd deploy docker-compose up -d首次执行会拉取约70G的镜像,半小时左右完成(取决于网速,建议连WiFi)。当 Docker 里出现3 个 Running 状态的容器就算成功:TTS 语音合成、ASR 语音识别、视频生成各一个。配置见 deploy/docker-compose.yml。
两个可选变体:
- 显存/硬盘较小:
docker-compose -f docker-compose-lite.yml up -d(只起视频生成1个服务) - 50系列显卡:
docker-compose -f docker-compose-5090.yml up -d
第4步:安装客户端
从官方发布页下载对应系统的安装包(Windows 是 .exe 双击安装,Linux 是 .AppImage 直接运行),打开后它会自己检测本地三个服务是否就绪。
训练第一个数字人:4步完成形象与声音克隆
服务跑起来后,创建第一个数字分身大概是这样:
- 录素材:一段 10 秒左右的正面视频,光线充足、背景干净,视频里必须有你本人在说话——这段声音是语音克隆的原料,纯无声视频会直接报错
- 上传视频:点 Create Avatar 上传素材,等待训练完成(约30分钟,包含面部特征提取和语音模型训练)
- 写文案:训练好后进 Create Video,输入一段文字,或用 8 种语言(中、英、日、韩、法、德、阿拉伯语、西班牙语)之一
- 生成视频:系统合成音频并驱动口型,完成后在 My Works 里直接播放、下载
原理速览:10秒视频如何变成数字分身
架构上就是"一个桌面客户端 + 三个本地 Docker 服务"。客户端(Electron + Vue)只负责界面和流程编排,重活都由容器干,彼此通过本机端口通信:TTS 服务(fish-speech,18180 端口)、ASR 服务(fun-asr,10095 端口)、视频生成服务(8383 端口)。
一条口播视频的完整数据流:
- 你上传的视频先用 FFmpeg 分离为「静音视频 + 人声」
- 人声送去训练语音模型,ASR 负责把参考音频转成文字供后续对齐
- 生成时,你输入的文案先经 TTS 合成为"你的声音"
- 视频生成服务用这段音频驱动分身口型,渲染出最终口播视频
想深入的话,从 src/main/service/model.js(模型训练)、src/main/service/video.js(视频合成)、src/main/service/voice.js(语音处理)三个文件入手最直观。
本地部署的数字分身能用来做什么
- 教育培训
- 批量生产章节讲解视频
- 同一课程出一套多语言版本
- 课件更新时只需改文案,不用重拍
- 企业应用
- 标准化的产品演示片
- 风格统一的员工培训材料
- 对外宣传保持品牌形象一致
- 自媒体创作
- 一次写稿、多次出片,提高口播视频产量
- 固定个人出镜形象,建立识别度
- 音画全程本地处理,素材不经过第三方平台
本地部署常见坑与排查
部署过程中最容易卡住的三个问题,按「现象 → 动作」排查:
docker-compose up -d拉镜像超时(request canceled / timeout)- 现象:三个容器全部报
Error response from daemon - 动作:Docker Hub 直连不稳定。在 Docker 的 Docker Engine 设置里加
registry-mirrors国内镜像源后重启,再重新执行启动命令:
- 现象:三个容器全部报
创建数字人报错或无响应(Connection refused)
- 现象:上传素材后训练失败,日志里 ASR 连接被拒
- 动作:先确认素材视频有人声(无声音频无法做声音克隆);再注意 ASR 服务启动较慢,三个服务起来后等几分钟再发起克隆;内存只有16G的机器可能根本起不来,需按硬件要求升级
三个服务起不来或反复重启
- 现象:容器状态不是 Running
- 动作:执行
nvidia-smi检查显卡和驱动是否就绪(这是最常见原因);其次确认客户端和服务端都是最新版本,服务端可在/deploy目录重新执行docker-compose up -d更新
更完整的排查步骤和提问模板见 doc/常见问题.md。
收尾:现在开始你的数字分身
一句话总结:Duix.Avatar 让你用一段10秒视频,在自己电脑上免费造一个能说话的数字分身,数据全程不出门。
资源入口:
- 完整安装文档:README_zh.md(含 Ubuntu 22.04 与50系显卡方案)
- 部署配置:deploy/docker-compose.yml
- 排障指南:doc/常见问题.md
- 社区交流:项目技术交流邮箱 james@duix.com
下一步行动:先按部署章节把三个服务拉到 Running,然后录一段10秒的说话视频,把第一个数字分身训练出来——跑通这一遍,后面就只是换文案的事了。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考