Duix.Avatar:本地部署AI数字人,10秒视频克隆会说话的数字分身
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款完全开源的AI数字人(由 AI 生成、会说话会表情的虚拟形象)项目,支持本地部署与全程离线运行:上传一段10秒左右的视频即可完成数字人克隆(复刻外貌与声音),再输入文案就能产出口播视频,不收订阅费用,数据不出本机,适合自媒体、教育、企业宣传以及拥有 NVIDIA 显卡的个人用户。
📌 结果先行:10秒视频到成片口播视频
部署完成前,先看清楚这套流程能产出什么,对应三个常见场景:
自媒体口播场景。你只需拍一段10秒的讲话视频,系统就能克隆出一个长相相似、声音相近的数字分身。在客户端里粘贴一篇500字左右的资讯文案,等待几分钟,得到的是一段口型与内容对齐的口播视频。
课程预览场景。教研组克隆一次统一的"数字教师",之后各科老师输入课堂要点文案,各自获得标准口播的预告视频,不必反复排期补拍。
企业公告场景。企业创建一个品牌代言人形象,输入通知文案或直接上传录音音频,就能输出介绍视频;同一形象还可以做多语言版本。
与买现成服务相比,差异主要在四行:
| 维度 | 商业数字人服务 | Duix.Avatar |
|---|---|---|
| 费用 | 数万元年费或按分钟计费 | 开源免费,使用次数不限 |
| 数据流向 | 视频、音频、文案都上传云端 | 全部留在自己的电脑里 |
| 可定制性 | 只能用厂商开放的功能 | 源码可改,接口可调用 |
| 硬件 | 无要求 | 需要一台带 NVIDIA 显卡的电脑 |
🧰 动手前检查:核对硬件并验证显卡驱动
装软件之前先对照四张"门槛",任何一条不满足,三个服务都起不来:
- 系统:Windows 10(19042.1526 或更高版本)或 Ubuntu 22.04
- 显卡:NVIDIA 显卡,RTX 30/40/50 系列均可,50 系列要用专用 compose 文件
- 内存:32G 及以上,16G 容易导致语音识别服务起不来
- 磁盘:镜像存放约 100G 空闲空间,形象和作品数据另备 30G
显卡驱动验证命令,在终端里执行这一条:
nvidia-smi
能打印出显卡型号和驱动版本的表格,说明驱动就绪;提示找不到命令,就先补装 NVIDIA 驱动再继续。
⚙️ 从零到跑起来:WSL、Docker 与服务端六步部署
- 装 WSL(Windows 子系统,Docker 在 Windows 上运行的底座):在 PowerShell 执行
wsl --install,已装过的机器直接跳过。 - 装 Docker:从官网下载 Docker Desktop 的 Windows 安装包并安装,首次启动时接受许可协议、跳过登录即可。
- 迁移镜像存储:Docker 默认把镜像放在系统盘,而本项目要下载约 70G;打开 Docker Desktop 的 Settings → Resources → Advanced,把 Disk image location 改到另一个磁盘,重启 Docker 生效。
- 拉取代码:执行
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar。 - 启动服务端:进入仓库的 deploy 目录,执行
docker-compose up -d(Ubuntu 用docker-compose -f docker-compose-linux.yml up -d),等待约30分钟让三个服务下载并启动完成。 - 装客户端:到项目发布页下载对应系统的安装包,Windows 双击 exe 安装,Ubuntu 直接运行 AppImage 文件。
compose 配置文件均在 deploy 目录,可按显卡型号选择。
🎬 做出第一个数字人:素材、克隆到成片
备素材。拍一段10–20秒的讲话视频:人物正面入镜、面部光线充足、背景干净,且视频里必须有清晰的说话声——系统要拿这段声音做声音克隆,无声素材必然失败。
上传克隆。打开客户端,点击 Create Avatar,选中视频上传,系统自动提取面部特征与声音特征,完成数字人克隆,全程约几分钟。
文案生成视频。在 My Avatars 列表选中刚建好的形象,填入口播文案(也可以直接上传音频文件),点击生成,等待几分钟后,成片会自动存入 My Works,可直接播放或导出。
🩺 踩坑速查:三个高频问题的修复
1. 服务启动报超时错误
- 现象:
docker-compose up -d打印 request timeout、context canceled。 - 根因:本地网络连 Docker Hub 官方源不稳定,镜像下载到一半断开。
- 一步解决:在 Docker Desktop 的 Docker Engine 配置文件里加入 registry-mirrors 国内镜像源,保存重启 Docker,再重新执行 compose 命令。
2. 新增模特直接报错
- 现象:上传视频后,创建形象这一步失败。
- 根因:视频里没有清晰的真人说话声,声音克隆缺少参考样本。
- 一步解决:换一段10–20秒、发音清晰的讲话素材重新上传。
3. 生成进度卡住不动
- 现象:进度条停在某个百分比,或日志出现 Connection refused。
- 根因:语音识别服务启动慢还没就绪(内存偏小时更易发生),或音频路径异常,需靠日志定位。
- 一步解决:服务端启动后先等几分钟再执行克隆;用客户端设置里的"打开日志"查看客户端日志,再打开 Docker Desktop 里对应服务的日志面板看具体报错。
更多报错类型可查 常见问题文档。
🚀 进阶玩法:多语言、批量生成、API 自动化
- 多语言:文案引擎支持中、英、日、韩、法、德、阿、西 8 种语言,切换语言即可出本地化口播内容。
- 批量生成:一次提交多个生成任务,适合口播内容的批量产出。
- API 自动化:Docker 启动后三个服务在本地开放端口,可通过
http://127.0.0.1依次调用模特训练、音频合成、视频合成接口,调用示例参考 src/main/service/。
🔍 它是怎么跑的:三个服务与四步数据流
三个服务各管一段:ASR 语音识别(把说话转成文字)、TTS 语音合成(按文本生成同音色语音)、视频生成服务(口型对齐与画面合成)。
数据流四步:①上传视频拆成静音视频与音频;②ASR 把音频转写成参考文本;③TTS 按输入文案合成同音色音频;④视频服务把音频与画面合成口播视频。
👥 谁适合用:四类用户各一行
- 自媒体创作者:不用出镜也能稳定产出口播内容,同一选题做多语言版本。
- 教育机构:用统一数字教师做标准化课程视频,省去反复排期拍摄。
- 企业团队:品牌数字人长期产出产品介绍与内部通知。
- 个人用户:家人纪念影像、个性化祝福视频,全程离线不担心隐私。
✅ 收尾:五步行动清单
- 执行
nvidia-smi,确认显卡驱动通过验证。 - 按六步完成部署,在 Docker Desktop 里确认三个服务均为 Running。
- 拍摄一段10秒、讲话清晰的素材视频。
- 通过 Create Avatar 克隆出第一个数字人形象。
- 输入文案生成第一段口播视频,收进 My Works 管理。
社区在持续补充实时交互、更丰富表情等方向,也欢迎提交部署教程与优化经验参与共创;授权条款见 LICENSE。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考