news 2026/9/11 4:00:59

10 秒把自己变成AI数字人:Duix.Avatar本地部署新手完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
10 秒把自己变成AI数字人:Duix.Avatar本地部署新手完整指南

10 秒把自己变成AI数字人:Duix.Avatar本地部署新手完整指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款真正开源的 AI 数字人克隆工具:只需提交一段 10 秒左右的正面视频,就能在本机完成数字人形象和声音的克隆,之后输入一段文案或上传一段音频,即可自动生成口型匹配的口播视频。整套流程全离线运行,素材不离开你的电脑。下面从"它能做什么、需要什么配置、怎么部署、怎么用"四个角度,把这套开源数字人方案讲清楚。

🧩 先看成品:一个界面,两个核心动作

两个主按钮:Create Avatar 与 Create Video

客户端主界面很克制,核心就两个入口:

  • Create Avatar:上传一段你自己的视频(10 秒左右),系统会同时提取你的外貌和声音,生成一个可复用的"数字人模型"。
  • Create Video:选择已训练好的模型,输入文字或上传音频,点生成,得到一条口型同步的数字人口播视频。

下方的 My Works / My Avatars 列表分别管理你的视频作品和数字人模型,支持多模型导入与切换,方便按场景挑选不同"分身"。

"全离线"不是噱头,是它的核心卖点

商业数字人产品大多把素材传到云端处理。而这个项目把 ASR、TTS、视频合成三个服务全部跑在你自己的显卡上:录制的形象视频、写的文案、生成的音频,全程不上网。对企业内训视频、内部宣传稿这类不方便外发的场景,这一点几乎是刚需。

💻 动手之前:先核对硬件和磁盘

一张可直接照抄的配置表

项目最低/官方要求备注
系统Windows 10 19042.1526+ 或 Ubuntu 22.04 Desktop内核 6.8.0-52-generic 已验证
GPUNVIDIA 显卡 + 正确安装的驱动硬性要求,没有它服务起不来
内存32G 及以上官方标注"必要"
CPU推荐 i5-13400F 级别参考配置为 RTX 4070
磁盘(Windows)D 盘空闲 >30G,Docker 镜像盘 >100G镜像默认存 C 盘,不足可改位置
带宽首次拉镜像约 70G 流量建议连 WiFi,耗时约半小时

Ubuntu 版本要求更简单:磁盘空闲 100G 以上即可。当前项目版本为 1.0.6,客户端基于 Electron + Vue3 构建。

按你的显卡选一份 docker-compose

deploy/ 目录下有四份编排文件,对应不同场景:

  • docker-compose.yml:标准三服务(ASR + TTS + 视频合成),绝大多数人选它;
  • docker-compose-lite.yml:轻量版,只启动视频合成服务,适合已有 TTS/ASR 方案的玩法;
  • docker-compose-5090.yml:面向 RTX 50 系列显卡(官方已用 5090 测试通过,30/40 系列 CUDA 12.8 用户也可用);
  • docker-compose-linux.yml:Ubuntu 环境专用。

🚀 新手部署时间线:从空机到三个服务跑起来

第 1 步:装 WSL 2 和 Docker(Windows)

命令行执行wsl --install安装 WSL,再用wsl --update更新到 2 版;然后安装 Docker Desktop。这里有个容易忽略的点:镜像默认存在 C 盘的 WSL 目录里,如果 C 盘不足 100G,可以在 Docker 的 Settings → Resources 里把 Disk image location 改到别的盘。

第 2 步:拉镜像并启动服务

先克隆仓库:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

这一行命令会拉取guiji2025/fun-asrguiji2025/fish-speech-zimingguiji2025/duix.avatar三个镜像(合计约 70G,视网速约半小时)。完成后用docker ps检查,三个容器都处于 Running 状态即部署成功。拉镜像如果一直失败,参考 doc/常见问题.md 里配置的国内镜像源方案。

第 3 步:装客户端,开始克隆

从官方 Release 下载对应安装包(Windows 为 exe,Ubuntu 为免安装的 AppImage),双击安装后连接本机服务端即可。右上角菜单的 Open Log 可以随时查看客户端日志,排查连接问题很有用。

🔍 幕后拆解:一条视频是怎么被"拼装"出来的

三个服务,各管一段

整套流水线由三个容器协作完成,职责清晰:

  1. fun-asr(语音识别):把训练视频里的声音转成文字,作为克隆声音的"参照文本"。它基于开源的 FunASR 项目;
  2. fish-speech-ziming(语音合成):基于 fish-speech,用你 10 秒的录音作参考音频,把任意文案读成你的声音,支持中、英、日、韩、法、德、阿拉伯、西语共 8 种语言;
  3. duix.avatar(视频合成):用你的形象视频 + 上一步生成的音频,驱动口型输出最终视频。

理解这条链路后,任何一个环节出错都能快速定位到对应服务。

记住三个端口和两个数据目录

端口服务用途
18180TTS声音克隆、音频合成
10095ASR语音转文字
8383视频合成提交/查询合成任务

数据落在两个约定目录(Windows 下为D:\duix_avatar_data\voice/dataface2face,映射关系在 deploy/docker-compose.yml 里可以看到),清理磁盘或换盘时心里有数。

🛠️ 进阶玩法:绕过界面,用 API 自己组流程

三个接口覆盖完整链路

服务端在本地暴露了 HTTP 接口,官方在 src/main/service/ 目录的model.jsvideo.jsvoice.js里就是现成的调用示例:

  • POST http://127.0.0.1:18180/v1/preprocess_and_tran:提交参考音频,返回后续合成要用的asr_format_audio_urlreference_audio_text,相当于"模特训练";
  • POST http://127.0.0.1:18180/v1/invoke:传入文本和上一步的返回值,得到克隆声音的音频文件;
  • POST http://127.0.0.1:8383/easy/submit提交音频+形象视频做合成,再用/easy/query?code=任务码轮询进度。

有了这三个接口,你就可以把数字人写进自己的自动化脚本:批量文案进、批量口播视频出,适合课程更新、账号矩阵等高频场景。

不想折腾部署?两条捷径

  • 社区已有基于 Docker 单镜像的 8G 显存可用整合包(模型约 10G,不再要求 100G 硬盘),显存紧张的朋友可以去社区搜一搜;
  • 项目同时上线了 Coze 平台的克隆智能体与插件,免部署直接使用,适合先体验效果再决定要不要本地自建。

⚠️ 使用边界:这几个限制要提前知道

NVIDIA 显卡是硬性入场券

本项目所有算力都在本地 GPU 上跑,没有 NVIDIA 显卡或驱动没装好,三个服务直接起不来。动手前先执行nvidia-smi验证显卡和驱动正常——这是官方"提问前自查"清单里的第一条。

最容易踩的两个坑

  1. 训练视频必须有真人说话的声音。形象克隆同时依赖画面和声音,上传一段无声视频会直接报错,这是新增模特时最常见的失败原因;
  2. 服务端日志是排查第一现场。出问题优先看三个容器的日志(Docker 里点对应容器的 Logs 页),客户端侧用 Open Log 查看。比如下面这个 TTS 容器的file not exists报错,就是典型的素材路径/文件缺失问题:

商用边界

项目支持全球免费商用,但用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议(协议见仓库根目录 LICENSE 及模型社区许可协议 PDF)。个人和中小团队正常使用没有额外费用。


回到最开始的场景:你有一张能跑的 NVIDIA 显卡、约 100G 空闲磁盘和半小时带宽时间,就能拥有一套完全私有化的 AI 数字人产线——10 秒视频克隆形象与声音,文案进、口播视频出,全程数据不出内网。它的边界同样明确:必须依赖 NVIDIA GPU、首次拉镜像较重、口型效果以"可用"而非"电影级"为标准。对于内部培训、自媒体口播、批量内容生产这类高频场景,这套开源方案的性价比几乎没有对手;而追求极致口型效果或企业级 SLA 的团队,则可以把本文的 API 链路作为起点,在自有服务上做更深的定制。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 4:00:31

军工级Web大文件上传方案:跨浏览器分片与加密传输实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 4:00:20

Spark大数据分析在餐饮行业的实战应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 3:58:23

Langfuse+WebSocket构建AI对话实时监控仪表盘

纯粹聊技术,聊我从0到1搭这个系统时踩过的泥坑。先把话说在前面:这不是一篇教程,更像是我做完整个项目后的复盘笔记,顺手把能“抄作业”的代码和配置都贴出来。你如果正准备给基于大模型的应用加一个实时监控仪表盘,或…

作者头像 李华
网站建设 2026/9/11 3:57:53

力扣Hot100刷题效率低?亲手搭建Java本地调试模板全攻略

先把话说在前面:如果你刷力扣还在“在线编辑器里手写代码、提交、看报错、再改”的死循环里打转,那我强烈建议你停下来,花一个晚上搭一套自己的力扣Hot100 Java本地模板。这套东西做完之后,刷题的速度、对代码的掌控感&#xff0c…

作者头像 李华
网站建设 2026/9/11 3:56:59

嵌入式AI工作台:用API构建本地化、可审计的AI辅助开发系统

1. 项目概述:为什么嵌入式工程师需要自己的 API 工作台? “嵌入式工程师的 AI 辅助开发实践:低成本搭一套顺手的 API 工作台”——这个标题里藏着三个被行业长期忽视却正在剧烈变化的现实:第一,嵌入式开发早已不是单打…

作者头像 李华
网站建设 2026/9/11 3:56:34

AlphaFold 二硫键预测实战:半胱氨酸配对与 SSBOND 校验指南

AlphaFold 二硫键预测实战:半胱氨酸配对与 SSBOND 校验指南 【免费下载链接】alphafold Open source code for AlphaFold 2. 项目地址: https://gitcode.com/GitHub_Trending/al/alphafold 拿到一条含 6 个半胱氨酸(Cys,带可被氧化成二…

作者头像 李华