news 2026/9/11 15:04:44

Duix.Avatar:本地部署AI数字人,10秒视频克隆会说话的数字分身

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar:本地部署AI数字人,10秒视频克隆会说话的数字分身

Duix.Avatar:本地部署AI数字人,10秒视频克隆会说话的数字分身

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款完全开源的AI数字人(由 AI 生成、会说话会表情的虚拟形象)项目,支持本地部署与全程离线运行:上传一段10秒左右的视频即可完成数字人克隆(复刻外貌与声音),再输入文案就能产出口播视频,不收订阅费用,数据不出本机,适合自媒体、教育、企业宣传以及拥有 NVIDIA 显卡的个人用户。

📌 结果先行:10秒视频到成片口播视频

部署完成前,先看清楚这套流程能产出什么,对应三个常见场景:

自媒体口播场景。你只需拍一段10秒的讲话视频,系统就能克隆出一个长相相似、声音相近的数字分身。在客户端里粘贴一篇500字左右的资讯文案,等待几分钟,得到的是一段口型与内容对齐的口播视频。

课程预览场景。教研组克隆一次统一的"数字教师",之后各科老师输入课堂要点文案,各自获得标准口播的预告视频,不必反复排期补拍。

企业公告场景。企业创建一个品牌代言人形象,输入通知文案或直接上传录音音频,就能输出介绍视频;同一形象还可以做多语言版本。

与买现成服务相比,差异主要在四行:

维度商业数字人服务Duix.Avatar
费用数万元年费或按分钟计费开源免费,使用次数不限
数据流向视频、音频、文案都上传云端全部留在自己的电脑里
可定制性只能用厂商开放的功能源码可改,接口可调用
硬件无要求需要一台带 NVIDIA 显卡的电脑

🧰 动手前检查:核对硬件并验证显卡驱动

装软件之前先对照四张"门槛",任何一条不满足,三个服务都起不来:

  • 系统:Windows 10(19042.1526 或更高版本)或 Ubuntu 22.04
  • 显卡:NVIDIA 显卡,RTX 30/40/50 系列均可,50 系列要用专用 compose 文件
  • 内存:32G 及以上,16G 容易导致语音识别服务起不来
  • 磁盘:镜像存放约 100G 空闲空间,形象和作品数据另备 30G

显卡驱动验证命令,在终端里执行这一条:

nvidia-smi

能打印出显卡型号和驱动版本的表格,说明驱动就绪;提示找不到命令,就先补装 NVIDIA 驱动再继续。

⚙️ 从零到跑起来:WSL、Docker 与服务端六步部署

  1. 装 WSL(Windows 子系统,Docker 在 Windows 上运行的底座):在 PowerShell 执行wsl --install,已装过的机器直接跳过。
  2. 装 Docker:从官网下载 Docker Desktop 的 Windows 安装包并安装,首次启动时接受许可协议、跳过登录即可。
  3. 迁移镜像存储:Docker 默认把镜像放在系统盘,而本项目要下载约 70G;打开 Docker Desktop 的 Settings → Resources → Advanced,把 Disk image location 改到另一个磁盘,重启 Docker 生效。
  4. 拉取代码:执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar
  5. 启动服务端:进入仓库的 deploy 目录,执行docker-compose up -d(Ubuntu 用docker-compose -f docker-compose-linux.yml up -d),等待约30分钟让三个服务下载并启动完成。
  6. 装客户端:到项目发布页下载对应系统的安装包,Windows 双击 exe 安装,Ubuntu 直接运行 AppImage 文件。

compose 配置文件均在 deploy 目录,可按显卡型号选择。

🎬 做出第一个数字人:素材、克隆到成片

备素材。拍一段10–20秒的讲话视频:人物正面入镜、面部光线充足、背景干净,且视频里必须有清晰的说话声——系统要拿这段声音做声音克隆,无声素材必然失败。

上传克隆。打开客户端,点击 Create Avatar,选中视频上传,系统自动提取面部特征与声音特征,完成数字人克隆,全程约几分钟。

文案生成视频。在 My Avatars 列表选中刚建好的形象,填入口播文案(也可以直接上传音频文件),点击生成,等待几分钟后,成片会自动存入 My Works,可直接播放或导出。

🩺 踩坑速查:三个高频问题的修复

1. 服务启动报超时错误

  • 现象:docker-compose up -d打印 request timeout、context canceled。
  • 根因:本地网络连 Docker Hub 官方源不稳定,镜像下载到一半断开。
  • 一步解决:在 Docker Desktop 的 Docker Engine 配置文件里加入 registry-mirrors 国内镜像源,保存重启 Docker,再重新执行 compose 命令。

2. 新增模特直接报错

  • 现象:上传视频后,创建形象这一步失败。
  • 根因:视频里没有清晰的真人说话声,声音克隆缺少参考样本。
  • 一步解决:换一段10–20秒、发音清晰的讲话素材重新上传。

3. 生成进度卡住不动

  • 现象:进度条停在某个百分比,或日志出现 Connection refused。
  • 根因:语音识别服务启动慢还没就绪(内存偏小时更易发生),或音频路径异常,需靠日志定位。
  • 一步解决:服务端启动后先等几分钟再执行克隆;用客户端设置里的"打开日志"查看客户端日志,再打开 Docker Desktop 里对应服务的日志面板看具体报错。

更多报错类型可查 常见问题文档。

🚀 进阶玩法:多语言、批量生成、API 自动化

  • 多语言:文案引擎支持中、英、日、韩、法、德、阿、西 8 种语言,切换语言即可出本地化口播内容。
  • 批量生成:一次提交多个生成任务,适合口播内容的批量产出。
  • API 自动化:Docker 启动后三个服务在本地开放端口,可通过http://127.0.0.1依次调用模特训练、音频合成、视频合成接口,调用示例参考 src/main/service/。

🔍 它是怎么跑的:三个服务与四步数据流

三个服务各管一段:ASR 语音识别(把说话转成文字)、TTS 语音合成(按文本生成同音色语音)、视频生成服务(口型对齐与画面合成)。

数据流四步:①上传视频拆成静音视频与音频;②ASR 把音频转写成参考文本;③TTS 按输入文案合成同音色音频;④视频服务把音频与画面合成口播视频。

👥 谁适合用:四类用户各一行

  • 自媒体创作者:不用出镜也能稳定产出口播内容,同一选题做多语言版本。
  • 教育机构:用统一数字教师做标准化课程视频,省去反复排期拍摄。
  • 企业团队:品牌数字人长期产出产品介绍与内部通知。
  • 个人用户:家人纪念影像、个性化祝福视频,全程离线不担心隐私。

✅ 收尾:五步行动清单

  1. 执行nvidia-smi,确认显卡驱动通过验证。
  2. 按六步完成部署,在 Docker Desktop 里确认三个服务均为 Running。
  3. 拍摄一段10秒、讲话清晰的素材视频。
  4. 通过 Create Avatar 克隆出第一个数字人形象。
  5. 输入文案生成第一段口播视频,收进 My Works 管理。

社区在持续补充实时交互、更丰富表情等方向,也欢迎提交部署教程与优化经验参与共创;授权条款见 LICENSE。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 15:03:23

Duix.Avatar 数字人视频离线制作实战指南

Duix.Avatar 数字人视频离线制作实战指南 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar …

作者头像 李华
网站建设 2026/9/11 15:02:16

Midscene.js实战指南:用视觉AI写出E2E测试

Midscene.js实战指南:用视觉AI写出E2E测试 【免费下载链接】midscene GUI Agent for E2E Testing 项目地址: https://gitcode.com/GitHub_Trending/mid/midscene Midscene.js 是一个面向 E2E 测试的 GUI Agent,你用自然语言写指令,AI …

作者头像 李华
网站建设 2026/9/11 15:01:56

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Tren…

作者头像 李华
网站建设 2026/9/11 14:57:39

从Demo翻车到生产稳定:FDE落地实战避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华