30分钟本地部署Duix-Avatar,生成第一条AI数字人口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
录一段10秒视频,丢进自己的电脑,十分钟后得到一条自己"说话"的视频——这就是Duix-Avatar本地部署之后你能做到的事。这套开源AI数字人工具全程离线完成形象与声音克隆,素材和声音数据都锁在自己的电脑里,不会上传云端。如果你是个人创作者、自媒体博主或小型内容团队,按下面的步骤操作,大约半小时就能在自己的机器上产出第一条口播视频。
先确认你的电脑跑不跑得动,4项硬件逐一过
本地部署翻车,最常见的原因在硬件上。这个项目把所有算力都放在本地,并依赖CUDA加速,动手前先对着下表自查一遍:
| 配置项 | 要求 | 快速自检方式 |
|---|---|---|
| 显卡 | NVIDIA显卡(推荐RTX 4070及以上) | 到NVIDIA官网驱动页核对型号,确认该卡支持CUDA |
| 内存 | 32GB及以上 | 系统设置里查看"已安装的内存" |
| CPU | 第13代英特尔酷睿i5-13400F或更高(推荐) | 用CPU-Z查看型号与核心数 |
| 存储 | C盘≥100GB、D盘≥30GB(Ubuntu则130GB+空闲) | 文件资源管理器查看各分区可用空间 |
| 系统 | Windows 10 19042.1526或更高,或Ubuntu 22.04桌面版 | 右键"此电脑"→属性,查看系统版本 |
必须是NVIDIA显卡:AMD显卡和核显带不动这三个服务容器,这一步不达标就不用往下走了。
存储要求主要花在两处:Docker镜像文件占C盘(约100GB),训练出的形象和生成的作品存放在D盘(约30GB)。空间不够时,装完Docker后可以把它的数据目录改到空余更大的磁盘上。
备齐WSL和Docker,把三个服务拉起来
装好WSL与Docker Desktop
- 打开终端执行
wsl --list --verbose,查看是否已装WSL;没有就用wsl --install安装。 - 执行
wsl --update更新WSL,终端提示更新成功即可。 - 到Docker官网下载Windows版Docker Desktop安装,首次启动接受协议并跳过登录。
- 验证标准:系统托盘的Docker图标保持Running状态,基础环境就绪。
获取项目代码并拉取服务镜像
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar本地部署需要三个服务镜像:一个负责语音识别(fun-asr),一个负责语音合成(fish-speech-ziming),一个负责视频生成(duix.avatar)。在终端依次拉取:
docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar镜像下载约70GB流量,耗时半小时左右,建议连WiFi耐心等待。
用docker-compose一键启动三个服务
服务配置放在仓库的deploy 目录里:标准版启动三个服务,lite版只启动视频生成服务。
cd deploy docker-compose up -d打开Docker Desktop的容器页面验证:三个服务都显示Running,说明本地数字人服务已经就绪。
图1:Docker容器日志界面,状态区显示Running,本地数字人服务全部就绪
装好客户端,连上本地服务
- 下载官方构建的Windows安装包(Ubuntu用户下载AppImage,双击即可运行)。
- 双击
Duix.Avatar-x.x.x-setup.exe完成安装。 - 启动客户端,首次运行勾选同意用户协议,进入主界面。
验证标准:主界面顶部有"Create Video"(生成口播视频)和"Create Avatar"(克隆形象)两个横幅入口,下方是"My Works"和"My Avatars"两个标签页。
图2:客户端主界面,Create Video与Create Avatar分别是口播视频生成和形象创建入口
🎬 一段10秒视频,克隆出你的数字形象
录制10-15秒的训练视频
- 正面拍摄,纯色或绿幕背景,光线充足
- 面部清晰、表情自然,包含简单的转头动作
- 视频里必须有你在说话的音频,程序要从中克隆你的声音
- 建议分辨率720p以上,录完存到本地
上传素材并启动训练
- 主界面点击"Create Avatar",上传录好的视频。
- 输入模型名称,选择性别与年龄段,点击开始训练。
- 等待5-10分钟;完成后"My Avatars"标签页会出现你的形象卡片,点开可预览。
输入台词,生成第一条口播视频
用文本驱动生成
- 选中训练好的形象,点击"Create Video"。
- 在文本框输入台词,第一次建议50字以内。
- 选择语音风格,按需调整语速、语调。
- 点击生成,等待3-5分钟,成片会自动存进"My Works",可预览、下载。
图3:客户端My Works标签页,展示已生成的数字人口播视频作品
让成片更专业的5个做法
- 绿幕背景拍摄:后期可替换任意场景背景,口型区域更干净、画面更稳。
- 调面部参数:口型区域发虚时,可在本地配置文件里提高面部检测置信度、切换到高精度面部特征点(只改本地配置文件,不动仓库代码)。
- 多形象管理:不同表情风格(微笑、严肃)各训练一个模型,按视频内容切换数字人;定期清理不用的模型释放空间。
- API批量出片:Docker服务启动后,视频合成接口暴露在本地127.0.0.1,传入音频与视频路径即可提交任务:
curl -X POST http://127.0.0.1:8383/easy/submit \ -H "Content-Type: application/json" \ -d '{"audio_url":"D:/duix_avatar_data/audio.wav","video_url":"D:/duix_avatar_data/video.mp4","code":"task-001","chaofen":0,"watermark_switch":0,"pn":1}'- 后期精修:把导出的视频导进常用剪辑软件,加字幕、背景音乐和转场,再发布。
常见故障、性能调优与求助渠道
常见故障速查
| 现象 | 可能原因 | 处理办法 |
|---|---|---|
| 三个服务容器起不来 | Docker未启动,或NVIDIA驱动未装 | 先启动Docker;装完驱动执行nvidia-smi验证 |
| 拉镜像缓慢或卡住 | Docker Hub官方源连接不稳定 | 在Docker配置中设置国内镜像源后重新拉取 |
| 新建模特时报错 | 训练视频无声或没有人说话 | 重新录一段10-15秒、含清晰人声的视频 |
| 训练卡住、提示连接被拒 | 内存不足,或asr服务尚未启动完成 | 关闭其他程序;服务启动后等几分钟再训练 |
| 客户端连不上服务 | 18180或8383端口被占用 | 检查占用该端口的进程并关闭,再重启容器 |
按配置档次参考的性能参数
需要按自己的配置调节渲染参数时,改本地配置文件即可(同样只动本地配置文件,不动仓库代码):
- 低配(i5+32GB+RTX 4070):渲染质量medium,面部细节等级2,批大小1,线程数4
- 中配(i7+64GB+RTX 4080):渲染质量high,面部细节等级3,批大小2,线程数8
- 高配(i9+128GB+RTX 4090):渲染质量ultra,面部细节等级4,批大小4,线程数16
日志怎么拿、问题去哪问
故障没解决时,先看日志:客户端日志入口在右上角菜单里;服务端日志在Docker里打开对应服务,复制日志输出。仓库内的常见问题收录了连接失败、克隆报错等典型情况,可以对照自查。
图4:Docker容器日志界面,复制日志便于在数字人社区求助时附上
接下来你可以试:用本地API加脚本做批量出片,一次跑多条台词;建一套不同形象、不同声音的"数字员工"库,按内容类型切换形象;或者把导出的口播视频直接接进你日常使用的剪辑工具,打通后期流程。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考