10分钟跑通实时数字人直播:LiveTalking完整快速指南
【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream
直播间的数字人为什么总慢半拍?话没问完口型还在动,说到一半想插话,得等整句播完。LiveTalking 是开源的实时交互流式数字人引擎,用文本或音频驱动数字人实时说话,口型随语音同步生成并推流。读完这篇,你在一块显卡上就能让数字人开口、随问随停。
一眼看懂能力
LiveTalking:实时交互流式数字人引擎,音视频同步对话
- 多模型:wav2lip、musetalk、ultralight 可选
- 声音克隆:指定音色让数字人开口
- 实时打断:说话中途插话,立刻停下
- 三种输出:WebRTC / RTMP / 虚拟摄像头
内部数据流分四层:API 层(文本、音频两个入口)→ 逻辑层(LLM 生成回复、TTS 合成语音、提取口型特征)→ 渲染层(模型推理出口型,后处理贴回高清视频)→ 推流层(WebRTC 低延迟推流、RTMP 推直播平台、虚拟摄像头)。TTS 内置 EdgeTTS、GPT-SoVITS、CosyVoice 等 9 种;想替换 TTS 或数字人模块,看 registry.py 的插件注册机制。
🚀 5步点亮第一个数字人
① 克隆代码
git clone https://gitcode.com/GitHub_Trending/me/metahuman-stream cd metahuman-stream② 装环境
官方在 Ubuntu 22.04 + Python 3.12 + CUDA 12.8 上验证过。如果nvidia-smi显示的 CUDA 不是 12.8,把 torch 那行换成对应版本(对照 PyTorch 官网)。
conda create -n livetalking python=3.12 conda activate livetalking pip install torch==2.9.1 torchvision==0.24.1 torchaudio==2.9.1 --index-url https://download.pytorch.org/whl/cu128 pip install -r requirements.txt像 pytorch3d 这类依赖装不上时,先看 assets/faq.md,里面有源码编译等处理办法。
③ 备模型
两个文件,从 README.md 给出的网盘链接下载:
wav2lip256.pth→ 重命名为wav2lip.pth,放进models/目录wav2lip256_avatar1.tar.gz解压后整个文件夹拷进data/avatars/
④ 启动服务
python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1服务端需放行 TCP 8010 与 UDP 1-65536 端口。
⑤ 验证效果
打开http://服务器IP:8010/index.html,点"开始连接"看到数字人画面,在文本框输入文字提交,数字人实时开口播报;右侧面板还能上传 wav 文件直接验证音频驱动。
三个让它实用的功能
声音克隆|一段参考音频,一个专属音色
在 config.yaml 里配置REF_FILE(16kHz 单声道 wav)和对应的REF_TEXT,数字人播报就用这个音色。品牌声线、个人 IP、多角色直播都用得上。
实时打断|插话不用等播完
/human接口支持 TTS 播放中途打断:你提问,数字人停,再回答。客服问答、直播互动这类高频交流场景,靠它省掉"等半句"的尴尬。
虚拟摄像头输出|数字人当摄像头用
加--transport virtualcam启动,OBS、腾讯会议、Zoom 都能把它选成摄像头设备,数字人直接进任何会议和直播间,具体接入见 docs/virtualcam_guide.md。
⚡ 3060够不够:硬件账本
| 模型 | 显卡 | 推理 FPS |
|---|---|---|
| wav2lip256 | RTX 3060 | 60 |
| wav2lip256 | RTX 3080Ti | 120 |
| musetalk | RTX 3080Ti | 42 |
| musetalk | RTX 3090 | 45 |
| musetalk | RTX 4090 | 72 |
人话版结论:wav2lip256 一张 RTX 3060 就能实时(≥25fps),musetalk 至少 3080Ti,要稳到 72 帧得上 4090。另外口型推理吃 GPU、视频压缩吃 CPU,路数越多 CPU 越吃紧,日志里inferfps和finalfps都 ≥25 才算真实时。
📦 Docker一条命令上线
不想配环境,直接用官方镜像(README.md 的 Docker 一节列有 AutoDL / UCloud 云镜像地址);老版镜像一条命令:
docker run --gpus all -it --network=host --rm registry.cn-beijing.aliyuncs.com/codewithgpu2/lipku-metahuman-stream:2K9qaMBu8v🛟 新手三个高频卡点
- 浏览器连不上视频:九成是端口没放。确认服务端开了 TCP 8010 + UDP 1-65536,云服务器记得安全组一并放行。
- 依赖装不上(pytorch3d、protobuf 等):逐条对照 assets/faq.md,按源码编译或版本钉死的方式处理,如 protobuf 固定到 3.20.1。
- RTMP 推不出去:ffmpeg 必须支持 libx264,运行
ffmpeg看输出里有没有;社区反馈 4.2.2 是稳的版本。
适合谁
想搭 24 小时直播数字主播或互动客服数字人的团队,先按上文跑通 wav2lip,再去 docs/api.md 对接接口。
【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考