news 2026/10/3 2:20:13

10秒克隆数字分身:Duix.Avatar 数字人本地部署与口播视频生成指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
10秒克隆数字分身:Duix.Avatar 数字人本地部署与口播视频生成指南

10秒克隆数字分身:Duix.Avatar 数字人本地部署与口播视频生成指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款完全开源、免费运行的 AI 数字人克隆工具,只需一段 10 秒左右的真人视频,它就能复刻你的形象和声音,之后输入一段文本或上传一段音频,就能自动合成口型匹配的口播视频。所有算力都跑在你自己的显卡上,不出内网、不付费、不限量。适合想做日更口播的内容创作者、要批量输出培训素材的企业团队,以及希望把视频生产线搬进内网的技术同学。

数字人口播视频:让一条 10 秒素材代替你反复出镜

以前做口播,改一个词就得重录一遍,一天最多两三条。把 10 秒素材交给 Duix.Avatar 克隆后,改稿只需重跑一次音频合成,形象和声音都不变。对自媒体账号来说,"日更口播"从每天面对镜头变成每天点一次生成。

内部培训与产品宣讲:把讲师的声音沉淀成可复用的资产

企业内部培训视频过去依赖某位讲师亲自出镜,人一请假就断更。克隆一次后,讲师只提供最新讲解文本,就能持续输出统一形象、统一声线的视频,新人入职培训按部门批量生成,不用再为场地、灯光和剪辑排期发愁。

多语言版本:同一份脚本,一次出多语种

脚本支持中文、英文、日文、韩文、法文、德文、阿拉伯文、西班牙文 8 种语言,配合声音克隆,同一个数字分身可以"说" 8 种语言。做出海账号或本地化课件时,不再需要请 8 个配音。

一条 docker-compose 命令拉起三个数字人服务

硬件前提一句话:一台装了 NVIDIA 显卡、32G 内存、100G 空闲磁盘的 Windows 10 或 Ubuntu 22.04 机器即可。仓库的 deploy 目录里已经写好了三份 compose 文件,你按下面 4 步走。

  • 克隆仓库并进入部署目录
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy
  • 启动服务端,三个容器(fun-asr、fish-speech-ziming、duix.avatar)都是 Running 就成功,首次拉镜像约 70G,官方给出的参考时间是半小时左右
docker-compose up -d
  • 从官方 Release 页拿.exe(Windows)或.AppImage(Ubuntu)双击安装,无需自己 build
  • 打开客户端,进入"创建数字人",上传一段 10 秒左右、正对镜头说话的视频,等克隆完成后就可以输入文案生成你的第一条口播视频

数字分身克隆:形象与声音一起复刻

它做什么:把一段真实拍摄的 10 秒视频拆成"静默视频 + 人声音频"两路,一路喂给图像模型学你的脸,一路喂给语音模型学你的音色。

怎么用:客户端"创建数字人"里上传素材即可。客户端侧的 src/main/service/model.js 会调用/v1/preprocess_and_tran把音频送去克隆,voice.js负责后续的语音合成。

得到什么:同一张脸、同一个声音,之后的所有视频都由模型生成,你不用再面对摄像头。

文本或音频驱动:一段文案直接变成口播视频

它做什么:把你想说的文字转成克隆音色朗读的音频,再拿这段音频驱动你的数字分身做口型与表情,最终输出一条可发布的视频文件。

怎么用:进入"创建视频",粘贴脚本或上传 wav,点生成。底层链路由 src/main/service/video.js 负责,它会调/easy/submit提交任务,再轮询/easy/query拿进度。

得到什么:从文本到成片通常在几分钟内完成,口型与发音基本对齐,可以直接发布到短视频平台。

常见报错处理:镜像拉不下来、克隆失败、日志怎么看

现象:docker-compose up -d报net/http: request canceled或context canceled。原因:Docker Hub 官方源在国内访问不稳定。 解决:在 Docker Desktop → Settings → Docker Engine 里加registry-mirrors数组,配置国内镜像源后再重试,官方 FAQ 给了可直接抄的示例。

现象:克隆形象时提示file not exists或抛出堆栈。原因:上传的素材视频没有声音,或不是人在说话,程序必须靠人声来训练声音模型。 解决:换一段带清晰人声、口齿清楚的正面视频重新上传。

现象:ASR 服务反复Connection refused。原因:Duix.Avatar-asr启动较慢,或者机器内存小于 32G 起不来。 解决:服务端启动后等 3~5 分钟再触发克隆;内存不足时先扩内存,或先只跑 lite 版本(只起Duix.Avatar-gen-video一个容器)。

现象:想看具体报在哪里。解决:客户端右上角"打开日志"能看到本地main.log的位置;服务端则在 Docker 容器里点 Logs 标签页直接复制。

从这里开始你的第一次数字人克隆

Duix.Avatar 把过去动辄几十万元的数字人建模,压缩成 32G 内存 + 一张 N 卡 + 一条docker-compose命令的组合,隐私和成本都留给了你自己。先把仓库克隆下来,按上面 4 步跑通服务端,再拿你自己的 10 秒视频完成第一次形象克隆——从敲命令到出片,参考时间大约是半小时,取决于你的网速和磁盘。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 2:18:35

Tool Graph Retriever: Exploring Dependency Graph-based Tool Retrieval for Large Language Models

文章主要内容和创新点 主要内容 本文针对大型语言模型(LLM)驱动的AI代理在工具检索中存在的问题,提出了一种名为Tool Graph Retriever(TGR,工具图检索器) 的方法。 背景:随着AI代理配备的工具数量激增,受限于模型上下文长度,需通过检索筛选工具。现有方法主要依赖用…

作者头像 李华