news 2026/9/11 15:01:56

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个本地开源数字人项目:上传约 10 秒的说话视频,就能克隆形象和声音,之后输入文案或音频即可生成口型同步的播报视频。全流程在自己的机器上离线跑完,从装环境到出第一支成片,顺利的话半小时左右。

先跑起来

架构分两部分:Docker 服务端(ASR、TTS、视频合成三个模型服务)+ Electron 桌面客户端。所有算力在服务端,客户端只负责操作,所以部署顺序是「先服务端、后客户端」。

1. 拉代码,起服务端。Windows 需要先装 Docker Desktop(WSL2 后端);Ubuntu 22.04 直接装 Docker 即可:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy

Ubuntu 缺依赖先执行:

sudo apt install docker.io docker-compose

然后在 deploy 目录执行:

docker-compose up -d

首次拉镜像约 70G,看网速半小时到一小时。Docker 里看到Duix.Avatar-asrDuix.Avatar-ttsDuix.Avatar-gen-video三个服务全部 Running 就算服务端就绪。NVIDIA 50 系列显卡改用docker-compose -f docker-compose-5090.yml up -d;显存紧张、只想跑视频合成的,用 lite 版 compose 文件(单服务)。

2. 启动客户端。从项目 Releases 下载 Windows 安装包(.exe)或 Ubuntu 的 AppImage,双击即用,无需装环境。偏好源码构建的:装 Node.js 18,在仓库根目录npm install && npm run dev即可,客户端代码在 src/ 目录。

3. 产出第一个结果。客户端里两步:

  • Create Avatar:上传一段 10 秒左右、人正在说话的带声音视频。服务端做音画分离、ASR 转写、声音建模,得到一个数字人模型;
  • Create Video:选中该模型,输入播报文案,稍等几分钟即可导出成片,口型与语音自动对齐。

能做出什么

输入固定是「一个数字人模型 + 一段文案或音频」,输出是带口型的说话视频。几个实际用法:

  • 电商商品口播:输入商品卖点文案 + 店主 10 秒片段,输出固定出镜人的商品介绍视频;换一版卖点,改文案重新生成就行,不用重录。
  • 客服帮助中心:输入 FAQ 单条答案文本,输出数字人讲解视频,嵌进帮助页,新用户的完播率通常好于纯文字。
  • 周报/内部公告:输入周报摘要,输出统一数字人形象的口播视频,适合要求「视频里要有真人感」又不想真人露面的内部分发。

原理扫一眼

整条链路四步:上传视频先被拆成无声视频 + 音频;音频进 ASR 服务(FunASR)得到参考文本,同时进 TTS 服务(fish-speech)完成声音克隆;生成时,TTS 先把文案合成语音,视频合成服务再按音频节奏驱动原视频口型逐帧变化,最后渲染成口型对齐的成片。三个服务都是本地 Docker 容器,数据不出机器,各接口的调用逻辑可以看 src/main/service/video.js。

调优与排错

最低配置要求

  • 显卡是硬门槛:没有 NVIDIA 显卡或驱动没装好,三个服务起不来。推荐 RTX 4070 级别,8G 显存可用;
  • 内存建议 32G 以上;硬盘空闲 100G+(镜像约 70G,再留空间存成片)。Windows 上 C 盘不够时,在 Docker Desktop 的 Settings → Resources → Advanced 里把 WSL 镜像目录改到其他盘。

参数建议

  • 建模视频 10 秒足够:画面清晰、人在说话、环境音少,声音建模质量直接决定后续 TTS 相似度;
  • 文案分段生成,每段 30~50 字比较稳,接口的 topP 0.7、temperature 0.7 等参数默认值即可;
  • 5090 或 30/40 系列装 CUDA 12.8 的,统一走 5090 那份 compose 文件。

首次生成失败排查

  1. docker-compose up -d报 registry-1.docker.io 连接超时:Docker Hub 官方源不稳定,在/etc/docker/daemon.json里配 registry-mirrors 指向国内镜像源,或开全局代理;
  2. 创建模特报错:上传的视频必须有人说话且带声音,静音片段会在 ASR 环节直接失败;
  3. 服务反复重启、客户端报 Connection refused:先nvidia-smi确认能输出显卡信息,再看三个服务是否都 Running,都正常的话按 doc/常见问题.md 的自查步骤走。

定位问题时最有用的是两份日志:客户端日志在应用内的日志入口查看,服务端日志直接打开对应 Docker 服务的 Logs 页,具体位置 doc/常见问题.md 里有配图。成片质量基本由建模视频决定,而重做一次只花几分钟——挑一段最清晰的 10 秒,拍完就够用了。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 14:57:39

从Demo翻车到生产稳定:FDE落地实战避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 14:56:00

Social-Auto-Upload:一键多平台发布保姆级跑通

Social-Auto-Upload:一键多平台发布保姆级跑通 【免费下载链接】social-auto-upload 自动化上传视频到社交媒体:抖音、小红书、视频号、tiktok、youtube、bilibili 项目地址: https://gitcode.com/GitHub_Trending/so/social-auto-upload 一条视频…

作者头像 李华
网站建设 2026/9/11 14:55:34

心理咨询师培训费用一般多少?不同班型的价格区间分析

心理咨询师培训费用一般多少?不同班型的价格区间分析公众号:意心职业技能、意心技能课堂心理咨询师培训费用因地区、机构、班型和课程级别的不同而有所差异。根据2024-2025年的市场行情,四级心理咨询师培训费用一般在3000-6000元之间&#xf…

作者头像 李华
网站建设 2026/9/11 14:55:10

AlphaFold 预测结果解读:pLDDT 四个分数段与 PAE 热图的读法

AlphaFold 预测结果解读:pLDDT 四个分数段与 PAE 热图的读法 【免费下载链接】alphafold Open source code for AlphaFold 2. 项目地址: https://gitcode.com/GitHub_Trending/al/alphafold 很多人拿到 AlphaFold 预测结果,第一反应是不敢直接信。…

作者头像 李华
网站建设 2026/9/11 14:53:58

让AI替你点网页:Midscene.js 自然语言驱动 UI 自动化上手

让AI替你点网页:Midscene.js 自然语言驱动 UI 自动化上手 【免费下载链接】midscene GUI Agent for E2E Testing 项目地址: https://gitcode.com/GitHub_Trending/mid/midscene Midscene.js 是一款视觉驱动的 UI 自动化开源工具,你只需用一句自然…

作者头像 李华