news 2026/9/11 16:55:15

Duix.Avatar 数字人本地部署指南:4 步跑通离线克隆与口播视频生成

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar 数字人本地部署指南:4 步跑通离线克隆与口播视频生成

Duix.Avatar 数字人本地部署指南:4 步跑通离线克隆与口播视频生成

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个面向本地部署的开源 AI 数字人工具包,全流程离线运行:提交约 10 秒视频即可完成形象与声音克隆,再用文本或音频驱动数字人生成口播视频。项目面向需要批量制作口播视频、且不希望素材离开本机环境的内容创作者与开发者。本文基于仓库文档与 deploy/ 目录下的部署文件,给出 Windows / Ubuntu 两套环境的最小部署路径、核心能力拆解和常见故障排查项。

跑通后的效果预览

部署成功后的交付物是一个桌面客户端,包含两个主入口:创建数字人模型、用已有模型生成口播视频。语音克隆、口型合成、视频渲染全部发生在本机,不依赖外网。

部署前检查清单:硬件与软件

项目最低要求推荐
操作系统Windows 10 19042.1526 及以上 / Ubuntu 22.04同左;NVIDIA 50 系显卡走专用 compose 文件
显卡NVIDIA 显卡且驱动已安装(必需,3 个服务全部依赖 GPU)RTX 4070
内存16G 可能无法启动32G 及以上
磁盘Windows:C 盘 100G(镜像)+ D 盘 30G(数据);Ubuntu:100G 空闲SSD
软件Docker;构建客户端源码才需要 Node.js 18,安装官方构建包则不需要最新版

两点说明:Windows 下 C 盘不足 100G 时,可在 Docker 设置中把镜像目录改到空闲大于 100G 的磁盘;如果只需要视频合成能力,仓库提供 lite 配置,只启动一个服务。

最小路径:4 步跑通服务端与客户端

第 1 步:克隆仓库

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

部署配置在 deploy/ 目录,按系统选择:docker-compose.yml(Windows)、docker-compose-linux.yml(Ubuntu)、docker-compose-lite.yml(仅视频合成服务)。

第 2 步:准备 GPU 环境

服务端 3 个容器均声明runtime: nvidia,没有 NVIDIA 显卡或未装驱动时无法启动。先用nvidia-smi验证驱动;Ubuntu 还需安装 NVIDIA Container Toolkit 并配置 Docker runtime,完整命令见 README_zh.md「Ubuntu22.04 安装」一节。

第 3 步:启动服务

cd deploy docker-compose up -d

Ubuntu 执行docker-compose -f docker-compose-linux.yml up -d;NVIDIA 50 系显卡(30/40 系 CUDA 12.8 亦可)执行docker-compose -f docker-compose-5090.yml up -d。首次拉取约 70GB 镜像,耗时半小时左右,Docker 中出现duix-avatar-asrduix-avatar-ttsduix-avatar-gen-video三个 Running 服务即成功。

第 4 步:安装客户端并访问

Windows 用户安装项目 Release 中的Duix.Avatar-x.x.x-setup.exe;Ubuntu 用户直接运行Duix.Avatar-x.x.x.AppImage,root 用户需加--no-sandbox参数。客户端启动后进入主界面,能创建模型、提交视频任务,即为跑通。服务端端口参考:TTS 18180、ASR 10095、视频合成 8383,均绑定本地回环。

核心能力拆解:克隆、驱动与多语言

按用户可感知的能力划分,而不是源码模块:

  • 形象 + 声音双克隆:提交约 10 秒素材,系统自动分离静音视频与音频,音频侧走 fish-speech 做声音克隆,视觉侧建立 face2face 形象模型。素材必须包含人在说话的声音,否则无法完成声音克隆。
  • 双驱动方式:文本驱动(TTS 合成语音后驱动口型)与音频驱动(直接上传已有音频)二选一。
  • 8 种语言脚本:英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语。
  • 口型同步:音视频高度同步、口型自然,是duix.avatar服务(端口 8383)的核心产出。
  • 多模型管理:支持创建多个模型并本地存储、按需切换。

客户端对应逻辑集中在 模型服务、视频合成、语音处理 三个文件;Docker 侧同时暴露本地 HTTP 接口,可绕过客户端直接调用做集成。

典型任务实操

任务 1:克隆自己的数字分身

  • 输入:10 秒以上的正面视频,光线充足、有清晰人声说话内容。
  • 操作:主界面点击创建模型,上传素材,等待训练完成(自动分离声音、做 ASR 与声音克隆)。
  • 输出:模型列表中一个可驱动的数字人模型。

任务 2:用文本脚本生成口播视频

  • 输入:任务 1 的模型 + 一段文本脚本(支持上述 8 种语言)。
  • 操作:视频创作入口选择模型,粘贴文本,确认语音参数后提交。
  • 输出:作品列表中可预览、导出的口播视频。

任务 3:用音频驱动生成口播视频

  • 输入:已有音频文件(自录或他处合成)。
  • 操作:驱动方式切换为音频,上传文件后提交。
  • 输出:数字人按音频节奏与语调驱动口型的视频,适合需要保留固定录音语气的场景。

排查速查表:常见症状对照

症状排查项
服务起不来、容器反复退出nvidia-smi确认显卡与驱动 ② 内存是否达到 32G ③docker logs <容器名>看具体报错
docker-compose up -d拉镜像超时在 Docker 的daemon.json配置registry-mirrors镜像源后重启服务;确认网络连通
新增模特时报错(素材问题)素材视频必须带人声说话内容,无声视频无法用于声音克隆
训练报 Connection refusedASR 服务启动较慢,服务端启动后等几分钟再操作;确认duix-avatar-asr处于 Running
功能异常、怀疑版本落后deploy/重新执行docker-compose up -d更新服务端;客户端更新到最新构建

日志从两处获取:服务端在 Docker 服务列表中直接复制日志;客户端在设置页查看。

资源

  • 部署配置:deploy/docker-compose.yml、deploy/docker-compose-5090.yml(50 系显卡)
  • 常见问题与日志获取:doc/常见问题.md
  • 客户端服务层:src/main/service/(model / video / voice)
  • 许可:LICENSE,支持全球免费商用;用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议(仓库内附协议 PDF)

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 16:52:46

基于STM32的T12焊台温控系统:从PID到可控硅调功的完整实现

简介&#xff1a;面向STM32嵌入式入门开发者&#xff0c;这份基于STM32的T12悍台工程包&#xff0c;整合HAL库驱动、外设配置与配套文档&#xff0c;可帮助快速上手时钟、GPIO、ADC、PWM、中断、UART、I2C、SPI等核心外设&#xff0c;并理解实际硬件项目从配置到调试的完整流程…

作者头像 李华
网站建设 2026/9/11 16:50:58

强光分离与暗光增强:基于Retinex和YOLOv8的整合检测系统

简介&#xff1a;一份面向计算机视觉学习者的强光分离、暗光增强与目标检测整合系统&#xff0c;适用于需要同时处理光照干扰与物体识别的场景&#xff0c;也可作为YOLO等检测框架的入门与进阶参考。系统内置目标检测基础讲解&#xff0c;涵盖Two stage与One stage方法&#xf…

作者头像 李华
网站建设 2026/9/11 16:45:57

HDFS数据块迁移机制与优化实践

1. HDFS数据块迁移机制概述在Hadoop分布式文件系统(HDFS)中&#xff0c;数据块迁移是一个至关重要的底层机制。作为HDFS集群维护数据均衡和可靠性的核心功能&#xff0c;它直接影响着整个大数据平台的存储效率和稳定性。我曾在多个PB级HDFS集群上处理过数据迁移问题&#xff0c…

作者头像 李华
网站建设 2026/9/11 16:45:40

【技术笔记】让CodeMaker自动分析dump

概述 日常做windows程序开发的时候经常会遇到程序崩溃&#xff0c;需要我们对生成的dump文件进行分析来进一步定位程序问题点。但随着Ai时代的来临&#xff0c;未来会有越来越多的工作转到让Ai来帮我们对dump文件进行分析了。下面介绍一下如何让AI agent -- 【CodeMaker】并利用…

作者头像 李华
网站建设 2026/9/11 16:45:19

大模型API驱动的论文写作:分段生成与模型降级的工程实践

简介&#xff1a;基于AI大模型文本生成能力打造的论文写作工具项目&#xff0c;面向需要完成毕业论文、期刊论文、课程设计等各类学术写作任务的学生与科研人员&#xff0c;将自然语言处理与大模型能力融入实际应用&#xff0c;可生成超过万字的长篇内容&#xff0c;并自动引用…

作者头像 李华