news 2026/9/11 23:43:55

免费AI数字人本地部署:Duix.Avatar用10秒视频训练你的数字分身

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
免费AI数字人本地部署:Duix.Avatar用10秒视频训练你的数字分身

免费AI数字人本地部署:Duix.Avatar用10秒视频训练你的数字分身

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是免费开源的AI数字人工具:上传约10秒的真人说话视频,在本地克隆你的形象和声音,输入文案即可生成口播视频。适合不想把影像声音传上云端的教育者、内容创作者与企业培训人员。

项目速览:这款免费AI数字人工具能做什么

简单说,它把"录视频、克隆、配音、对口型"这套流程装进了一个桌面应用:你提供一段真人视频,它负责后续的 AI 数字人生成,全程不联网。

维度说明
它做什么克隆外貌+声音,文字/语音驱动,自动生成口型同步的口播视频
适合谁无编程基础的个人创作者、教师、企业培训人员
是否离线完全离线,数据和算力都在你自己的电脑上
部署成本一次性下载约70G镜像,之后无授权费、无月费

主界面只有两个核心入口:左侧 Create Video 直接用数字分身做视频,右侧 Create Avatar 先训练一个分身。下面的 My Works / My Avatars 分别管理你的作品和已训练的模型。

上手前的门槛:本地部署数字分身的硬件与软件要求

先把话说在前面:这个项目的所有算力都在本地,必须有一张装了驱动的英伟达显卡,否则三个服务都起不来。

硬件要求

部件要求备注
CPU13代 i5 起步(如 i5-13400F)官方推荐配置
内存32GB 及以上16GB 可能起不动 ASR 服务
显卡英伟达显卡,推荐 RTX 4070驱动装好后nvidia-smi能显示信息即可
硬盘100GB 以上空闲Windows:C盘存镜像需 >100G,D盘存数据需 >30G

软件环境

  • 系统:Windows 10 19042.1526 及以上,或 Ubuntu 22.04 Desktop
  • Docker:Windows 用 Docker Desktop(需先装 WSL),Ubuntu 用 apt 安装
  • 英伟达显卡驱动:必装项,装完跑一下nvidia-smi确认
  • Node.js 18:仅当你要从源码自己构建客户端时才需要,直接用官方安装包可跳过

5分钟部署开源AI数字人:从克隆代码到服务跑起来

整个部署核心就两条命令,其余时间都花在下载镜像上。

第1步:装好 Docker 和显卡驱动

  • Windows:先确认 WSL(wsl --list --verbose,没装过就wsl --installwsl --update),然后安装 Docker Desktop 并首次运行
  • Ubuntu:sudo apt update && sudo apt install docker.io docker-compose,再按官方流程装显卡驱动和 NVIDIA Container Toolkit
  • C盘空闲不足100G时,装完 Docker 可在设置里把镜像目录改到其他磁盘:

第2步:克隆项目代码

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

第3步:启动服务端

cd deploy docker-compose up -d

首次执行会拉取约70G的镜像,半小时左右完成(取决于网速,建议连WiFi)。当 Docker 里出现3 个 Running 状态的容器就算成功:TTS 语音合成、ASR 语音识别、视频生成各一个。配置见 deploy/docker-compose.yml。

两个可选变体:

  • 显存/硬盘较小:docker-compose -f docker-compose-lite.yml up -d(只起视频生成1个服务)
  • 50系列显卡:docker-compose -f docker-compose-5090.yml up -d

第4步:安装客户端

从官方发布页下载对应系统的安装包(Windows 是 .exe 双击安装,Linux 是 .AppImage 直接运行),打开后它会自己检测本地三个服务是否就绪。

训练第一个数字人:4步完成形象与声音克隆

服务跑起来后,创建第一个数字分身大概是这样:

  1. 录素材:一段 10 秒左右的正面视频,光线充足、背景干净,视频里必须有你本人在说话——这段声音是语音克隆的原料,纯无声视频会直接报错
  2. 上传视频:点 Create Avatar 上传素材,等待训练完成(约30分钟,包含面部特征提取和语音模型训练)
  3. 写文案:训练好后进 Create Video,输入一段文字,或用 8 种语言(中、英、日、韩、法、德、阿拉伯语、西班牙语)之一
  4. 生成视频:系统合成音频并驱动口型,完成后在 My Works 里直接播放、下载

原理速览:10秒视频如何变成数字分身

架构上就是"一个桌面客户端 + 三个本地 Docker 服务"。客户端(Electron + Vue)只负责界面和流程编排,重活都由容器干,彼此通过本机端口通信:TTS 服务(fish-speech,18180 端口)、ASR 服务(fun-asr,10095 端口)、视频生成服务(8383 端口)。

一条口播视频的完整数据流:

  1. 你上传的视频先用 FFmpeg 分离为「静音视频 + 人声」
  2. 人声送去训练语音模型,ASR 负责把参考音频转成文字供后续对齐
  3. 生成时,你输入的文案先经 TTS 合成为"你的声音"
  4. 视频生成服务用这段音频驱动分身口型,渲染出最终口播视频

想深入的话,从 src/main/service/model.js(模型训练)、src/main/service/video.js(视频合成)、src/main/service/voice.js(语音处理)三个文件入手最直观。

本地部署的数字分身能用来做什么

  • 教育培训
    • 批量生产章节讲解视频
    • 同一课程出一套多语言版本
    • 课件更新时只需改文案,不用重拍
  • 企业应用
    • 标准化的产品演示片
    • 风格统一的员工培训材料
    • 对外宣传保持品牌形象一致
  • 自媒体创作
    • 一次写稿、多次出片,提高口播视频产量
    • 固定个人出镜形象,建立识别度
    • 音画全程本地处理,素材不经过第三方平台

本地部署常见坑与排查

部署过程中最容易卡住的三个问题,按「现象 → 动作」排查:

  1. docker-compose up -d拉镜像超时(request canceled / timeout)
    • 现象:三个容器全部报Error response from daemon
    • 动作:Docker Hub 直连不稳定。在 Docker 的 Docker Engine 设置里加registry-mirrors国内镜像源后重启,再重新执行启动命令:

  1. 创建数字人报错或无响应(Connection refused)

    • 现象:上传素材后训练失败,日志里 ASR 连接被拒
    • 动作:先确认素材视频有人声(无声音频无法做声音克隆);再注意 ASR 服务启动较慢,三个服务起来后等几分钟再发起克隆;内存只有16G的机器可能根本起不来,需按硬件要求升级
  2. 三个服务起不来或反复重启

    • 现象:容器状态不是 Running
    • 动作:执行nvidia-smi检查显卡和驱动是否就绪(这是最常见原因);其次确认客户端和服务端都是最新版本,服务端可在/deploy目录重新执行docker-compose up -d更新

更完整的排查步骤和提问模板见 doc/常见问题.md。

收尾:现在开始你的数字分身

一句话总结:Duix.Avatar 让你用一段10秒视频,在自己电脑上免费造一个能说话的数字分身,数据全程不出门。

资源入口:

  • 完整安装文档:README_zh.md(含 Ubuntu 22.04 与50系显卡方案)
  • 部署配置:deploy/docker-compose.yml
  • 排障指南:doc/常见问题.md
  • 社区交流:项目技术交流邮箱 james@duix.com

下一步行动:先按部署章节把三个服务拉到 Running,然后录一段10秒的说话视频,把第一个数字分身训练出来——跑通这一遍,后面就只是换文案的事了。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 23:43:51

音视频SDK选型指南:实时互动、直播、点播三大场景技术拆解

聊音视频SDK选型,最怕的不是不知道选哪家,而是拿着一堆功能对比表比了半天,上线第一天就被延迟、卡顿、杂音问题打爆。市面上主流的音视频SDK在宣传口径上都很漂亮,动不动就是“全场景覆盖”“极致体验”,可真落到自己…

作者头像 李华
网站建设 2026/9/11 23:43:48

买保险,为什么没人天然站在你这边?聊聊锦鲤保站在哪一边

你大概有过这种感觉: 想买份保险,打开产品页面,条款越看越迷糊;问卖保险的朋友,每人推荐的又不一样;好不容易买了,心里也不踏实——将来真出事了,到底赔不赔,还有没有人能…

作者头像 李华
网站建设 2026/9/11 23:41:43

AI提示工程与用户行为预测:技术对比与职业发展

1. 传统AI提示设计与用户行为预测的十字路口作为一名在AI领域摸爬滚打多年的提示工程架构师,我经常被同行问到一个核心问题:职业发展究竟该深耕传统提示设计,还是转向用户行为预测方向?这个问题就像站在技术演进的十字路口&#x…

作者头像 李华
网站建设 2026/9/11 23:41:13

智能门锁核心技术解析与行业趋势展望

1. 德施曼获奖背后的行业意义解读德施曼在智能门锁领域一次性斩获五项大奖,并入选《2025中国智能门锁行业白皮书》,这个成绩绝非偶然。作为深耕智能安防领域十余年的从业者,我亲眼见证了这家企业从技术追随者到标准制定者的蜕变历程。这次获奖…

作者头像 李华
网站建设 2026/9/11 23:39:43

STM32+MPU6050:I2C读取六轴数据并串口打印的完整实现

简介:这是一份基于STM32F103C8T6的MPU6050六轴数据读取工程源码,面向需要快速上手陀螺仪与加速度计开发的嵌入式初学者,解决原始数据采集并串口输出的问题。项目采用IIC通信,硬件接线清晰(SDA接PB6,SCL接PB…

作者头像 李华
网站建设 2026/9/11 23:38:13

CNN人脸识别考勤系统实战:预训练模型选型与阈值调优

简介:一套基于CNN的人脸识别考勤系统完整源码包,面向计算机视觉初学者、毕业设计开发者及需要快速落地考勤场景的工程师。资源包含可直接运行的预训练模型(h5文件)与配套源码,省去从零训练的时间与算力成本&#xff1b…

作者头像 李华