Duix.Avatar 离线数字人视频生成指南:10 秒视频克隆形象与声音,自动产出同步口播
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
我录了 10 秒视频,Duix.Avatar 就在本地把我和我的声音克隆成了一个会说话的数字人,再喂段文案,它就自动产出一支口型对得上的口播视频。
它是什么 · 适合谁
Duix.Avatar 是一套免费、开源、可以完全离线运行的 AI 数字人工具。你不需要按次付费,也不用把素材传到别人的服务器上:只要上传一段 10 秒左右、本人在说话的短视频,它就能同时复刻你的形象和声音;之后无论是输入一段文字,还是直接上传一段音频,都能驱动这个「数字分身」对口型,自动剪出一支播报视频。所有计算都跑在你自己的显卡上,数据不出本地。
它比较适合这几类人:想做口播或知识类内容、又不想天天真人出镜打光收音的创作者;要给产品反复录讲解视频、追求效率的团队;需要多语言版本的出海业务;以及愿意折腾、想把生成能力接进自己产品里的开发者。如果你的目标是「不限次数、隐私留在本地」,自己把服务跑起来,通常比反复用云端试用更划算。
从零跑通第一支数字人视频
先给个预期:只要有一张 NVIDIA 显卡、内存 32G 以上,第一次跑通基本就是「装好 Docker → 拉镜像 → 起服务 → 装客户端」,顺利的话一个工作日内能出第一支视频。
在 Windows 上,一般先确认 WSL 可用、装好 Docker Desktop,然后进到 deploy/ 目录,跑一句docker-compose up -d,让声音合成、语音识别、视频生成三个服务在后台把镜像拉下来、把端口起起来。最花时间的是拉镜像,总共大约 70G,建议挂 WiFi 慢慢等。Ubuntu 22.04 用户则用仓库里对应的 Linux 版 compose 文件启动,客户端直接双击 AppImage 就能打开,无需额外安装。
等 Docker 里三个服务都变成 Running,服务端就算就绪了。这时装上官方客户端安装包,新建一个模特、上传那段说话视频,等它克隆完成,你就有了一个「会说话的自己」——这正是第一支视频的起点。
它能生成哪些数字人内容
把能力按「你能做成什么」拆开看会更清楚:
- 克隆一个数字分身:一次上传,形象和声音一起被复刻,支持多种声音参数,让音色尽量贴近原声。
- 两种驱动方式:把一段文字交给它读(文字驱动),或上传已有音频让它对口型(语音驱动),两种方式都会自动做口型同步。
- 一支内容、多种语言:脚本支持中、英、日、韩、法、德、阿、西八种语言,同一套素材可以出不同语言版本。
- 多模型并行管理:可以导入并管理多个克隆模型,按不同用途切换使用。
几个真实用法:我想完成什么任务
按「我想做成什么事」来想,会更容易上手:
让一个形象批量出多支口播
克隆一次形象,之后每次写一段新文案、点一下生成,就能出一支新视频。做系列内容、日更口播时,不用反复真人出镜、布置场景、重新收音。
给产品录一支讲解视频
把产品介绍的文字给到数字人,让它「说」出来,口型自动对齐。讲解脚本有改动时重跑一遍即可,省掉重录和二次剪辑。
同一支内容,一次出多语言版本
同一套素材,切换语言重新生成,就能拿到外语讲解版本,适合出海或面向不同地区投放。
把长音频变成数字人讲解
如果你已经有一段播客或录音,可以直接拿它做驱动,把纯音频变成「有声有脸」的视频,比文字稿更适合传播。
把生成能力接进我自己的系统
服务端启动后会在本地开放模特训练、音频合成、视频合成几类接口(都走 127.0.0.1),开发者可以参考 src/main/service/ 里的调用示例,把生成能力嵌进自己的产品里。
让它更快更稳
- 拉镜像太慢:这是新手最常卡住的点。在 Docker 里配置国内镜像源后,速度会明显好转,拉取阶段就不用一直盯着了。
- 硬盘与磁盘空间:三个镜像加上运行数据体积不小,建议单独留出一块空间充足的盘;如果系统盘不够,可以在 Docker 的磁盘位置里把镜像目录指到别的盘,避免写满。
- 显存、内存别踩线:项目对显卡和内存有硬性要求,内存偏小(比如 16G)时,识别服务可能根本起不来。
- 显卡型号要对应:如果你用的是 50 系列等新卡,请用仓库里对应的 5090 启动方案,不要直接套默认配置。
- 保持两端都是最新版:社区更新比较频繁,很多坑在新版里已经修掉,遇到问题先升级服务端和客户端再去复现。
- 显存紧张可试 lite 版:资源吃紧时,用精简的 lite 方案只起视频生成服务,能少占一些开销。
常见状况处理
- 拉镜像超时、连接失败→ 多半是官方源不稳定,配置国内镜像源,或给网络加上稳定的代理后重新执行。
- 三个服务起不来→ 先确认机器确实有 NVIDIA 显卡、驱动装对了;本项目算力全在本地,没有合适的显卡,服务是拉不起来的。
- 克隆形象报
file not exists或连接被拒→ 通常是识别服务还没启动完,服务端刚起时稍等几分钟再操作;若内存太小,也可能是服务没起来。 - 客户端连不上、报错→ 先看客户端日志、再看对应 Docker 服务的日志,确认服务是否处于 Running;日志获取方式见 常见问题。
- Linux 下以 root 打开 AppImage 失败→ 在终端里加上
--no-sandbox参数再启动即可。
用得放心
它最大的安心之处是「全离线」:素材和生成结果都留在你自己的机器上,不经过第三方服务器,适合对隐私敏感的内容。同时要留意使用边界——被克隆的形象和声音应当是你本人、或你已获得明确授权的对象,不要用它冒充他人、或制造误导性内容。商用方面项目提供免费商用授权,但当用户规模或营收达到较大门槛时,企业需要另行签署商业许可协议,具体条款见 LICENSE。
最后
从「录 10 秒」到「出一支口型同步的口播视频」,Duix.Avatar 把数字人这件事做得足够轻、足够本地。如果你手上正好有一张 NVIDIA 显卡,不妨今天就把它跑起来,克隆出属于你的第一个数字分身。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考