10 秒把自己变成AI数字人:Duix.Avatar本地部署新手完整指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款真正开源的 AI 数字人克隆工具:只需提交一段 10 秒左右的正面视频,就能在本机完成数字人形象和声音的克隆,之后输入一段文案或上传一段音频,即可自动生成口型匹配的口播视频。整套流程全离线运行,素材不离开你的电脑。下面从"它能做什么、需要什么配置、怎么部署、怎么用"四个角度,把这套开源数字人方案讲清楚。
🧩 先看成品:一个界面,两个核心动作
两个主按钮:Create Avatar 与 Create Video
客户端主界面很克制,核心就两个入口:
- Create Avatar:上传一段你自己的视频(10 秒左右),系统会同时提取你的外貌和声音,生成一个可复用的"数字人模型"。
- Create Video:选择已训练好的模型,输入文字或上传音频,点生成,得到一条口型同步的数字人口播视频。
下方的 My Works / My Avatars 列表分别管理你的视频作品和数字人模型,支持多模型导入与切换,方便按场景挑选不同"分身"。
"全离线"不是噱头,是它的核心卖点
商业数字人产品大多把素材传到云端处理。而这个项目把 ASR、TTS、视频合成三个服务全部跑在你自己的显卡上:录制的形象视频、写的文案、生成的音频,全程不上网。对企业内训视频、内部宣传稿这类不方便外发的场景,这一点几乎是刚需。
💻 动手之前:先核对硬件和磁盘
一张可直接照抄的配置表
| 项目 | 最低/官方要求 | 备注 |
|---|---|---|
| 系统 | Windows 10 19042.1526+ 或 Ubuntu 22.04 Desktop | 内核 6.8.0-52-generic 已验证 |
| GPU | NVIDIA 显卡 + 正确安装的驱动 | 硬性要求,没有它服务起不来 |
| 内存 | 32G 及以上 | 官方标注"必要" |
| CPU | 推荐 i5-13400F 级别 | 参考配置为 RTX 4070 |
| 磁盘(Windows) | D 盘空闲 >30G,Docker 镜像盘 >100G | 镜像默认存 C 盘,不足可改位置 |
| 带宽 | 首次拉镜像约 70G 流量 | 建议连 WiFi,耗时约半小时 |
Ubuntu 版本要求更简单:磁盘空闲 100G 以上即可。当前项目版本为 1.0.6,客户端基于 Electron + Vue3 构建。
按你的显卡选一份 docker-compose
deploy/ 目录下有四份编排文件,对应不同场景:
docker-compose.yml:标准三服务(ASR + TTS + 视频合成),绝大多数人选它;docker-compose-lite.yml:轻量版,只启动视频合成服务,适合已有 TTS/ASR 方案的玩法;docker-compose-5090.yml:面向 RTX 50 系列显卡(官方已用 5090 测试通过,30/40 系列 CUDA 12.8 用户也可用);docker-compose-linux.yml:Ubuntu 环境专用。
🚀 新手部署时间线:从空机到三个服务跑起来
第 1 步:装 WSL 2 和 Docker(Windows)
命令行执行wsl --install安装 WSL,再用wsl --update更新到 2 版;然后安装 Docker Desktop。这里有个容易忽略的点:镜像默认存在 C 盘的 WSL 目录里,如果 C 盘不足 100G,可以在 Docker 的 Settings → Resources 里把 Disk image location 改到别的盘。
第 2 步:拉镜像并启动服务
先克隆仓库:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d这一行命令会拉取guiji2025/fun-asr、guiji2025/fish-speech-ziming、guiji2025/duix.avatar三个镜像(合计约 70G,视网速约半小时)。完成后用docker ps检查,三个容器都处于 Running 状态即部署成功。拉镜像如果一直失败,参考 doc/常见问题.md 里配置的国内镜像源方案。
第 3 步:装客户端,开始克隆
从官方 Release 下载对应安装包(Windows 为 exe,Ubuntu 为免安装的 AppImage),双击安装后连接本机服务端即可。右上角菜单的 Open Log 可以随时查看客户端日志,排查连接问题很有用。
🔍 幕后拆解:一条视频是怎么被"拼装"出来的
三个服务,各管一段
整套流水线由三个容器协作完成,职责清晰:
- fun-asr(语音识别):把训练视频里的声音转成文字,作为克隆声音的"参照文本"。它基于开源的 FunASR 项目;
- fish-speech-ziming(语音合成):基于 fish-speech,用你 10 秒的录音作参考音频,把任意文案读成你的声音,支持中、英、日、韩、法、德、阿拉伯、西语共 8 种语言;
- duix.avatar(视频合成):用你的形象视频 + 上一步生成的音频,驱动口型输出最终视频。
理解这条链路后,任何一个环节出错都能快速定位到对应服务。
记住三个端口和两个数据目录
| 端口 | 服务 | 用途 |
|---|---|---|
| 18180 | TTS | 声音克隆、音频合成 |
| 10095 | ASR | 语音转文字 |
| 8383 | 视频合成 | 提交/查询合成任务 |
数据落在两个约定目录(Windows 下为D:\duix_avatar_data\的voice/data与face2face,映射关系在 deploy/docker-compose.yml 里可以看到),清理磁盘或换盘时心里有数。
🛠️ 进阶玩法:绕过界面,用 API 自己组流程
三个接口覆盖完整链路
服务端在本地暴露了 HTTP 接口,官方在 src/main/service/ 目录的model.js、video.js、voice.js里就是现成的调用示例:
POST http://127.0.0.1:18180/v1/preprocess_and_tran:提交参考音频,返回后续合成要用的asr_format_audio_url和reference_audio_text,相当于"模特训练";POST http://127.0.0.1:18180/v1/invoke:传入文本和上一步的返回值,得到克隆声音的音频文件;POST http://127.0.0.1:8383/easy/submit提交音频+形象视频做合成,再用/easy/query?code=任务码轮询进度。
有了这三个接口,你就可以把数字人写进自己的自动化脚本:批量文案进、批量口播视频出,适合课程更新、账号矩阵等高频场景。
不想折腾部署?两条捷径
- 社区已有基于 Docker 单镜像的 8G 显存可用整合包(模型约 10G,不再要求 100G 硬盘),显存紧张的朋友可以去社区搜一搜;
- 项目同时上线了 Coze 平台的克隆智能体与插件,免部署直接使用,适合先体验效果再决定要不要本地自建。
⚠️ 使用边界:这几个限制要提前知道
NVIDIA 显卡是硬性入场券
本项目所有算力都在本地 GPU 上跑,没有 NVIDIA 显卡或驱动没装好,三个服务直接起不来。动手前先执行nvidia-smi验证显卡和驱动正常——这是官方"提问前自查"清单里的第一条。
最容易踩的两个坑
- 训练视频必须有真人说话的声音。形象克隆同时依赖画面和声音,上传一段无声视频会直接报错,这是新增模特时最常见的失败原因;
- 服务端日志是排查第一现场。出问题优先看三个容器的日志(Docker 里点对应容器的 Logs 页),客户端侧用 Open Log 查看。比如下面这个 TTS 容器的
file not exists报错,就是典型的素材路径/文件缺失问题:
商用边界
项目支持全球免费商用,但用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议(协议见仓库根目录 LICENSE 及模型社区许可协议 PDF)。个人和中小团队正常使用没有额外费用。
回到最开始的场景:你有一张能跑的 NVIDIA 显卡、约 100G 空闲磁盘和半小时带宽时间,就能拥有一套完全私有化的 AI 数字人产线——10 秒视频克隆形象与声音,文案进、口播视频出,全程数据不出内网。它的边界同样明确:必须依赖 NVIDIA GPU、首次拉镜像较重、口型效果以"可用"而非"电影级"为标准。对于内部培训、自媒体口播、批量内容生产这类高频场景,这套开源方案的性价比几乎没有对手;而追求极致口型效果或企业级 SLA 的团队,则可以把本文的 API 链路作为起点,在自有服务上做更深的定制。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考