news 2026/9/12 7:03:38

30分钟本地部署Duix-Avatar,生成第一条AI数字人口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
30分钟本地部署Duix-Avatar,生成第一条AI数字人口播视频

30分钟本地部署Duix-Avatar,生成第一条AI数字人口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

录一段10秒视频,丢进自己的电脑,十分钟后得到一条自己"说话"的视频——这就是Duix-Avatar本地部署之后你能做到的事。这套开源AI数字人工具全程离线完成形象与声音克隆,素材和声音数据都锁在自己的电脑里,不会上传云端。如果你是个人创作者、自媒体博主或小型内容团队,按下面的步骤操作,大约半小时就能在自己的机器上产出第一条口播视频。

先确认你的电脑跑不跑得动,4项硬件逐一过

本地部署翻车,最常见的原因在硬件上。这个项目把所有算力都放在本地,并依赖CUDA加速,动手前先对着下表自查一遍:

配置项要求快速自检方式
显卡NVIDIA显卡(推荐RTX 4070及以上)到NVIDIA官网驱动页核对型号,确认该卡支持CUDA
内存32GB及以上系统设置里查看"已安装的内存"
CPU第13代英特尔酷睿i5-13400F或更高(推荐)用CPU-Z查看型号与核心数
存储C盘≥100GB、D盘≥30GB(Ubuntu则130GB+空闲)文件资源管理器查看各分区可用空间
系统Windows 10 19042.1526或更高,或Ubuntu 22.04桌面版右键"此电脑"→属性,查看系统版本

必须是NVIDIA显卡:AMD显卡和核显带不动这三个服务容器,这一步不达标就不用往下走了。

存储要求主要花在两处:Docker镜像文件占C盘(约100GB),训练出的形象和生成的作品存放在D盘(约30GB)。空间不够时,装完Docker后可以把它的数据目录改到空余更大的磁盘上。

备齐WSL和Docker,把三个服务拉起来

装好WSL与Docker Desktop

  1. 打开终端执行wsl --list --verbose,查看是否已装WSL;没有就用wsl --install安装。
  2. 执行wsl --update更新WSL,终端提示更新成功即可。
  3. 到Docker官网下载Windows版Docker Desktop安装,首次启动接受协议并跳过登录。
  4. 验证标准:系统托盘的Docker图标保持Running状态,基础环境就绪。

获取项目代码并拉取服务镜像

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

本地部署需要三个服务镜像:一个负责语音识别(fun-asr),一个负责语音合成(fish-speech-ziming),一个负责视频生成(duix.avatar)。在终端依次拉取:

docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar

镜像下载约70GB流量,耗时半小时左右,建议连WiFi耐心等待。

用docker-compose一键启动三个服务

服务配置放在仓库的deploy 目录里:标准版启动三个服务,lite版只启动视频生成服务。

cd deploy docker-compose up -d

打开Docker Desktop的容器页面验证:三个服务都显示Running,说明本地数字人服务已经就绪。

图1:Docker容器日志界面,状态区显示Running,本地数字人服务全部就绪

装好客户端,连上本地服务

  1. 下载官方构建的Windows安装包(Ubuntu用户下载AppImage,双击即可运行)。
  2. 双击Duix.Avatar-x.x.x-setup.exe完成安装。
  3. 启动客户端,首次运行勾选同意用户协议,进入主界面。

验证标准:主界面顶部有"Create Video"(生成口播视频)和"Create Avatar"(克隆形象)两个横幅入口,下方是"My Works"和"My Avatars"两个标签页。

图2:客户端主界面,Create Video与Create Avatar分别是口播视频生成和形象创建入口

🎬 一段10秒视频,克隆出你的数字形象

录制10-15秒的训练视频

  • 正面拍摄,纯色或绿幕背景,光线充足
  • 面部清晰、表情自然,包含简单的转头动作
  • 视频里必须有你在说话的音频,程序要从中克隆你的声音
  • 建议分辨率720p以上,录完存到本地

上传素材并启动训练

  1. 主界面点击"Create Avatar",上传录好的视频。
  2. 输入模型名称,选择性别与年龄段,点击开始训练。
  3. 等待5-10分钟;完成后"My Avatars"标签页会出现你的形象卡片,点开可预览。

输入台词,生成第一条口播视频

用文本驱动生成

  1. 选中训练好的形象,点击"Create Video"。
  2. 在文本框输入台词,第一次建议50字以内。
  3. 选择语音风格,按需调整语速、语调。
  4. 点击生成,等待3-5分钟,成片会自动存进"My Works",可预览、下载。

图3:客户端My Works标签页,展示已生成的数字人口播视频作品

让成片更专业的5个做法

  • 绿幕背景拍摄:后期可替换任意场景背景,口型区域更干净、画面更稳。
  • 调面部参数:口型区域发虚时,可在本地配置文件里提高面部检测置信度、切换到高精度面部特征点(只改本地配置文件,不动仓库代码)。
  • 多形象管理:不同表情风格(微笑、严肃)各训练一个模型,按视频内容切换数字人;定期清理不用的模型释放空间。
  • API批量出片:Docker服务启动后,视频合成接口暴露在本地127.0.0.1,传入音频与视频路径即可提交任务:
curl -X POST http://127.0.0.1:8383/easy/submit \ -H "Content-Type: application/json" \ -d '{"audio_url":"D:/duix_avatar_data/audio.wav","video_url":"D:/duix_avatar_data/video.mp4","code":"task-001","chaofen":0,"watermark_switch":0,"pn":1}'
  • 后期精修:把导出的视频导进常用剪辑软件,加字幕、背景音乐和转场,再发布。

常见故障、性能调优与求助渠道

常见故障速查

现象可能原因处理办法
三个服务容器起不来Docker未启动,或NVIDIA驱动未装先启动Docker;装完驱动执行nvidia-smi验证
拉镜像缓慢或卡住Docker Hub官方源连接不稳定在Docker配置中设置国内镜像源后重新拉取
新建模特时报错训练视频无声或没有人说话重新录一段10-15秒、含清晰人声的视频
训练卡住、提示连接被拒内存不足,或asr服务尚未启动完成关闭其他程序;服务启动后等几分钟再训练
客户端连不上服务18180或8383端口被占用检查占用该端口的进程并关闭,再重启容器

按配置档次参考的性能参数

需要按自己的配置调节渲染参数时,改本地配置文件即可(同样只动本地配置文件,不动仓库代码):

  • 低配(i5+32GB+RTX 4070):渲染质量medium,面部细节等级2,批大小1,线程数4
  • 中配(i7+64GB+RTX 4080):渲染质量high,面部细节等级3,批大小2,线程数8
  • 高配(i9+128GB+RTX 4090):渲染质量ultra,面部细节等级4,批大小4,线程数16

日志怎么拿、问题去哪问

故障没解决时,先看日志:客户端日志入口在右上角菜单里;服务端日志在Docker里打开对应服务,复制日志输出。仓库内的常见问题收录了连接失败、克隆报错等典型情况,可以对照自查。

图4:Docker容器日志界面,复制日志便于在数字人社区求助时附上

接下来你可以试:用本地API加脚本做批量出片,一次跑多条台词;建一套不同形象、不同声音的"数字员工"库,按内容类型切换形象;或者把导出的口播视频直接接进你日常使用的剪辑工具,打通后期流程。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 7:03:12

Java中VarHandle与Unsafe性能对比及使用场景分析

1. 项目概述在Java 9发布后,VarHandle作为Unsafe的替代方案被引入,这引发了关于两者性能差异的热烈讨论。作为一名经历过多次Java技术面试的开发者,我发现途虎养车等一线互联网企业在面试中特别喜欢考察候选人对底层API的理解程度。VarHandle…

作者头像 李华
网站建设 2026/9/12 7:02:32

Espresso自动化测试底层原理与最佳实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 7:01:19

Flutter与鸿蒙API对接:Swagger自动化转换实践

1. 项目背景与核心价值在跨平台应用开发领域,Flutter与鸿蒙系统的对接一直存在API通信的适配难题。传统手动编写Dart模型的方式效率低下,而swagger_parser这个三方库的出现,恰好解决了Swagger文档到Dart模型的自动化转换问题。我最近在实际项…

作者头像 李华
网站建设 2026/9/12 7:01:02

MAUI手势识别防重击优化方案

1. MAUI手势识别中的防重击痛点解析在MAUI跨平台应用开发中,手势交互正成为提升用户体验的关键要素。我最近在开发一个医疗问诊应用时,发现医生用户频繁出现双击误触问题——当快速滑动查看病历影像时,系统错误地将连续点击识别为双击手势&am…

作者头像 李华
网站建设 2026/9/12 7:00:35

EN 50291标准解析与一氧化碳报警器设计要点

1. 项目概述:为什么EN 50291标准如此重要?在欧洲市场销售一氧化碳报警器,EN 50291认证是绕不开的硬门槛。这个看似枯燥的技术标准,实际上直接关系到千家万户的生命安全。2019年德国某品牌报警器因未通过EN 50291-1:2018的低温测试…

作者头像 李华