news 2026/9/11 15:03:07

Duix.Avatar开源数字人本地部署:一段10秒视频,离线生成口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar开源数字人本地部署:一段10秒视频,离线生成口播视频

Duix.Avatar开源数字人本地部署:一段10秒视频,离线生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

先说结果:一段10秒的说话视频进去,出来的是一条"你"用自己的声音念任意稿子的口播视频,全程在你的电脑上离线完成。这就是 Duix.Avatar——一个支持数字人形象克隆、口播视频生成的开源 AI 工具,所有算力都在本机 GPU 上跑,素材、音频、模型文件不出机器。

下文按"装完长什么样 → 怎么跑通 → 能力拆解 → 谁适合 → 坑"的顺序讲,看完你手里应该有一份可以直接照做的清单。

装完之后的形态:3 个 Docker 服务 + 1 个桌面客户端

先明确"跑通"的判定标准:你的机器上会同时运行三个容器——fun-asr(语音识别)、fish-speech-ziming(语音合成)、duix.avatar(视频合成),再加上一个桌面上的 Duix.Avatar 客户端。客户端主页只有两个核心入口:右侧上传视频克隆一个数字人(形象 + 声音),左侧用已有模型创作视频,后面所有功能都围绕这两个动作展开。

5 步跑通本地部署

上手前先看硬件门槛,官方推荐配置是 i5-13400F / 32G 内存 / RTX 4070,系统要求 Windows 10 19042.1526 以上或 Ubuntu 22.04 Desktop。两个硬性条件:必须有英伟达显卡且装好驱动(本项目没有 NVIDIA 显卡三个服务根本起不来);磁盘要留足——Windows 上 D 盘空闲大于 30G 存模型和作品,C 盘大于 100G 存服务镜像。C 盘不够的话,装完 Docker 后可在 Docker Desktop 的 Settings → Resources → Advanced 里把磁盘镜像位置改到别的盘:

步骤本身不复杂:

  1. Windows 先确认 WSL:wsl --list --verbose检查状态,没装就wsl --install,装完用wsl --update更新,再安装 Docker Desktop,首次启动接受协议并跳过登录;
  2. 拉取项目代码:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar
  3. 进入deploy目录(compose 文件都在 deploy/ 里),执行docker-compose up -d;只想要视频合成、不需要本地训练的话,用docker-compose -f docker-compose-lite.yml up -d,起来的服务只有Duix.Avatar-gen-video一个;
  4. 等待。首次拉镜像约 70G 流量,半小时左右(看网速),建议连 WiFi;
  5. Docker 里看到上述三个服务都在运行,就算成功。

客户端不用自己编译,下载官方构建的安装包:Windows 双击Duix.Avatar-x.x.x-setup.exe安装,Ubuntu 双击 AppImage 即可(root 用户桌面下要加--no-sandbox参数运行)。Ubuntu 服务端用docker-compose-linux.yml,并且要先装好 nvidia-container-toolkit。

能力实测:输入什么,得到什么

一段10秒说话视频 → 你的数字分身

建模时最容易踩的细节是:上传的视频必须带真人说话的声音。程序会把视频拆成静音视频 + 音频两条线,静音视频负责克隆外貌,声音负责克隆音色。如果素材没有说话声,这一步会直接报错——这也是社区 issue 里出现频率最高的一类。模型建好后在"My Avatars"里能看到,后续创作直接选用。

一段文案 → 口播成片

最常用的路径:选模型、贴文案,系统先用克隆音色合成语音,再按音频驱动口型出片。文案支持中、英、日、韩、法、德、阿拉伯、西八种语言。如果你手里已有录好的音频,还可以跳过文字合成,直接上传音频驱动口型,语音里的节奏和语调会体现在画面表现上。

这两步也开放了 API:Docker 起来后语音合成在127.0.0.1:18180,视频合成提交和进度查询在127.0.0.1:8383,完整的请求参数和返回结构可以参考 src/main/service/ 下的 model.js、video.js、voice.js。想接到自己的批量生产流程里,这是官方给的入口。

这套东西适合谁

说直白点:你在意人脸和声音数据落在哪里,或者高频产出口播内容、不想按次计费,这套本地方案就值得折腾。反过来两种情况建议先别装——机器上没有英伟达显卡的,服务起不来,换配置也没用;只是想偶尔做一两条视频的,为 70G 镜像和 100G 磁盘付出的时间成本可能比收益高。另外显卡是 50 系列的用户,要改用docker-compose-5090.yml(基于 torch 预览版本,30/40 系列开 CUDA 12.8 也可用)。

社区高频踩坑:拉镜像失败、建模报错、日志在哪看

第一次跑的时候,问题基本集中在三处,按你遇到的先后排:

  • docker-compose up -d拉镜像报 connection 超时:Docker Hub 官方源不稳定,在 Docker 的 daemon.json 里加 registry-mirrors 国内镜像源,或走全局网络;
  • 新增模特报错:九成是素材视频里没有人在说话,重录带清晰人声的片段即可。其他报错先自查三个服务是否都是 Running 状态;
  • 要贴日志:客户端从右上角菜单"Open Log"导出:

服务端则是点进对应 Docker 容器的 Logs 面板复制报错段,错误栈一般集中在请求处理的那几行:

更完整的自查流程和错误对照见 doc/常见问题.md。项目更新比较频繁,提问前建议先把服务端镜像和客户端都更新到最新版,不少问题已经被修掉了。

硬件核对没问题的话,就照上面的 5 步把服务跑起来,然后上传第一条 10 秒视频,看看效果再决定要不要深挖 API。项目地址:https://gitcode.com/GitHub_Trending/he/Duix-Avatar

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 15:02:16

Midscene.js实战指南:用视觉AI写出E2E测试

Midscene.js实战指南:用视觉AI写出E2E测试 【免费下载链接】midscene GUI Agent for E2E Testing 项目地址: https://gitcode.com/GitHub_Trending/mid/midscene Midscene.js 是一个面向 E2E 测试的 GUI Agent,你用自然语言写指令,AI …

作者头像 李华
网站建设 2026/9/11 15:01:56

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Tren…

作者头像 李华
网站建设 2026/9/11 14:57:39

从Demo翻车到生产稳定:FDE落地实战避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 14:56:00

Social-Auto-Upload:一键多平台发布保姆级跑通

Social-Auto-Upload:一键多平台发布保姆级跑通 【免费下载链接】social-auto-upload 自动化上传视频到社交媒体:抖音、小红书、视频号、tiktok、youtube、bilibili 项目地址: https://gitcode.com/GitHub_Trending/so/social-auto-upload 一条视频…

作者头像 李华
网站建设 2026/9/11 14:55:34

心理咨询师培训费用一般多少?不同班型的价格区间分析

心理咨询师培训费用一般多少?不同班型的价格区间分析公众号:意心职业技能、意心技能课堂心理咨询师培训费用因地区、机构、班型和课程级别的不同而有所差异。根据2024-2025年的市场行情,四级心理咨询师培训费用一般在3000-6000元之间&#xf…

作者头像 李华