【2026实测】如何在普通电脑上完成AI数字人本地部署:视频克隆到出片的全流程指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
你把自己对着镜头读稿的 10 秒视频丢给电脑,它能克隆出你的形象和声音,变成一个数字人。之后你只需要打一行字,它自己配音、自己做出口型,产出一条口播视频,不用拍、不用剪。这个工具叫 Duix.Avatar,一个开源的 AI 数字人项目:本地部署,用一段视频完成外貌和声音克隆,再用文字或音频驱动数字人出片。内容创作者想省掉付费数字人服务的话,可以重点看这个项目。
先看你的电脑能不能扛住
花钱折腾之前,先记住一条硬门槛:必须有英伟达显卡。项目里所有推理都靠 CUDA(GPU 的加速框架)干活,缺了它,服务根本起不来,AMD 显卡和核显都用不了。其他配置对着这张表看:
| 配置 | CPU | 内存 | 显卡 | 硬盘 |
|---|---|---|---|---|
| 最低配置 | i5 十代以上 | 16G | 8G 显存以上的 N 卡(如 RTX 3060) | 空闲 100G |
| 推荐配置 | i5-13400F | 32G | RTX 4070 | 200G SSD |
磁盘空间是另一个隐形坑。Windows 上,C 盘要放 Docker 镜像文件,空闲得大于 100G;不够的话,可以在 Docker 的 Resources 设置里把镜像存储位置挪到别的盘(下图就是入口)。D 盘放数字人形象和成片,留 30G 以上。系统要求 Windows 10 的 19042 版本及以上,Ubuntu 22.04 也官方支持。
把服务端跑起来 🚀
装 WSL 和 Docker
服务端本质上是三个 Docker 容器(Docker——把一套预配好的环境装进独立"集装箱"里运行的软件,省得你自己在机器上调环境)。Windows 上,Docker 跑在 WSL(Windows 自带的 Linux 子系统)之上。先确认状态:命令输出里列出了发行版,说明 WSL 已装好;没有就执行安装命令,装的时候记得设用户名和密码,网络原因失败的话多试几次。装完顺手把 WSL 更新到最新。再下载安装 Docker Desktop,双击启动,接受用户协议、跳过登录,环境部分就齐了。
拿代码,起容器
在终端执行 git clone https://link.gitcode.com/i/0d3db4ed9ebe6f3c3f37b16318e7f858 拉取项目代码,然后进入 deploy/ 目录,执行docker-compose up -d。它会开始下载三个镜像包,总量约 70G,速度看网速,半小时上下,记得连 WiFi 别中断。下载慢的话,去 Docker 的 Docker Engine 里配一个镜像加速器,相当于给拉取走国内通道,效果立竿见影。
两个变体:显卡是 50 系列(如 5090)的,改用 5090 专用的 compose 文件启动;只想要口型合成、不需要声音克隆的,可以启动 lite 版,只跑一个容器,更省显存和流量。
检查三个服务
下载完成后看 Docker Desktop 的容器列表,应该出现三个服务:ASR(语音识别——把你的样本音频转写成文字)、TTS(语音合成——用克隆的声音朗读文字)、视频合成,状态都是 Running。点开任一容器的 Logs 页签,能看到启动日志在滚动输出。有哪个是红色或者反复重启,先回头查磁盘空间和显卡驱动。
核心流程:10秒视频变数字人
装好客户端
服务端只是"机房",你实际操作的是客户端。从官方 releases 下载对应系统的安装包:Windows 双击 exe 安装;Ubuntu 拿到 AppImage 双击直接运行,不用安装。打开后首页很干净,就两块入口:Create Video(创建视频)和 Create Avatar(创建数字人)。
创建你的第一个数字人
点 Create Avatar,上传一段 10~15 秒的视频。素材要求不复杂:正面出镜、光线均匀、面部无遮挡、人脸居中。上传后系统自动把视频拆成无声画面和音频两条轨道——画面喂给数字人训练,音频送进 TTS 服务做声音样本。等进度走完,"My Avatars" 列表里多出一个带名字的条目,你的数字人就算克隆好了。
功能体验:一句话到一条成片
数字人建好之后,剩下的体验都是"输入什么 → 得到什么"。
- 文字驱动口播:选一个数字人,把文案贴进去点生成。系统先用克隆的嗓子把文字读成音频,再让数字人对上嘴型出画面。一分钟左右的文案,渲染大概几分钟。
- 上传音频:没有文案也行,直接上传一条现成的音频文件,数字人跟着音频的口型做视频,播客、采访录音都能这么翻成视频。
- 多语言文案:脚本支持中、英、日、韩、法、德、阿拉伯、西语共八种语言,换语言不用重新建数字人。
生成完成后,成片会自动出现在"我的作品"列表里,点开在线预览,满意就下载。
底层一瞥
不用深究,但有两个设计点值得知道。其一,三个服务各自独立成容器,靠本地端口互相调用:ASR 先把你的样本音频转成文字,TTS 拿这段文字做参照克隆声音,合成服务再把口型和音频逐帧对齐,各干各的活,哪个挂了不影响另一个。其二,全部计算都在你本机完成,人脸和声音数据从头到尾不出机器,这是离线数字人方案最核心的吸引力。
进阶指路:直接调 API
Docker 启动后,服务在本地暴露了端口:18180 管声音相关的事——先提交样本音频转写文字,再带着转写结果去合成语音;8383 管视频合成——提交任务,拿回任务编号,再拿编号轮询进度。接口都走 127.0.0.1,数据一个字节都不出机器。想全自动的话,提交视频、克隆声音、提交文本、收走成片,整条链路都能用脚本串起来,不用碰客户端。典型玩法:教育场景,同一个"老师"数字人批量生成系列课程;电商场景,数字人不变,换产品背景批量出商品讲解视频;客服场景,把企业知识库接上 API(API——程序之间互相请求和取结果的标准化接口),用短视频形式输出回复。
排障急救包 🩹
- 三个服务起不来、反复重启 → 没装英伟达显卡或没装驱动 → 装好 N 卡驱动,在终端敲 nvidia-smi 能看到显卡信息才算成功
- 镜像下载卡死或极慢 → 没配镜像加速 → 在 Docker Engine 里加国内镜像源,保存后重启 Docker
- 声音克隆报 file not exists → 音频文件不在容器挂载的目录里 → 对照 TTS 服务日志里的报错路径,把文件放进约定目录再提交
- 客户端能打开但连不上服务端 → 有服务掉线 → 回到 deploy 目录重新执行启动命令,把三个容器刷新一遍
- 卡住了先抓日志 → 客户端右上角菜单有"打开日志",日志目录里的 main.log 是主日志;服务端直接看对应容器的 Logs 页签,完整问题清单见 doc/常见问题.md
项目地址:Duix.Avatar
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考