从跑通到出片:JoyAI-Echo 分钟级长视频生成完整上手指南
【免费下载链接】JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。项目地址: https://ai.gitcode.com/jd-opensource/JoyAI-Echo
JoyAI-Echo 是一款分钟级多镜头音视频生成工具:给它一份镜头脚本,它能产出带同步音频的长视频,故事最长 5 分钟,角色外观和音色在镜头切换之间保持稳定,推理速度比原始多步管线快约 7.5 倍,单张 48GB 显存的显卡就能跑默认配置。官方 GSB 用户测试里,对比同场景竞品的偏好度为音频质量 81.7%、提示遵循 80.6%、视觉美观 63.6%、角色一致性 59.4%,长视频场景的优势比较明确。
机器能不能跑:显存、依赖和权重先核对
默认配置是 1280×736 分辨率、每镜头 241 帧、25fps,峰值显存约 46–50GB,所以单张 H100/A100(80GB)或任何 48GB 以上的卡都能直接跑。显卡更小也不是不能用,把帧数和分辨率降下来即可,命令见后文。
| 核对项 | 要求 |
|---|---|
| GPU 显存 | 峰值 46–50GB;单卡 48GB 起即可 |
| 软件栈 | Python 3.11 + PyTorch 2.8 + CUDA 12.8,另需 FFmpeg |
| 权重文件 | 主权重 echo-longvideo-release.safetensors 与文本编码器 gemma-3-12b/ |
软件栈对应仓库里的 environment.yml 和 requirements.txt,照着装即可。权重需要单独获取后放到推理目录下的 checkpoints/,布局固定为:
checkpoints/ ├── echo-longvideo-release.safetensors └── gemma-3-12b/另外注意许可边界:该项目基于 LTX-2,遵循 LTX-2 Community License,限定学术研究与非商业用途,商用需另行联系版权方。
第一次推理怎么跑通
代码和推理脚本从仓库获取:
git clone https://gitcode.com/jd-opensource/JoyAI-Echo cd JoyAI-Echo环境用 uv 两步搞定(也支持 conda,按 environment.yml 创建):
uv venv --python 3.11 .venv && source .venv/bin/activate uv pip install --extra-index-url https://download.pytorch.org/whl/cu128 -r requirements.txt权重就位后直接运行:
python inference.py结果输出在 inference_result/outputs/<提示文件名>/inference_<时间戳>/ 下,视频和音频在同一目录。第一次建议就用默认配置跑一个单镜头,确认画面、音频、输出路径都没问题,再去做多镜头。
提示词怎么写:每个镜头包含六个部分
提示词文件放在 prompts/ 目录下,内容是单个 JSON 对象,prompts 字段是一个字符串列表,每个字符串就是一个完整镜头:写一个字符串出单镜头,写多个就是多镜头故事。新镜头会自动参考前面镜头的视觉与语音记忆,故事级一致性由跨模态记忆库维持。
每个镜头内部按固定顺序写六部分,缺了哪部分,生成时哪部分就容易失控:
| 部分 | 写什么 |
|---|---|
| 角色与主体 | 画面中所有人的外观:年龄、体型、发型、五官、服装,有台词的还要写音色 |
| 动作与台词 | 角色做什么、说什么 |
| 风格 | 整体视觉与情绪基调,如写实电影感、冷调日光 |
| 镜头运动 | 景别与运镜,如面部稳定特写、腰部以上中景 |
| 背景 | 主体身后的场景与细节 |
| 音效与 BGM | 场景声音和背景音乐,或明确写"无背景音乐" |
官方特别强调一点:提示词先过增强器再推理。多镜头用 prompts/long_story_writer_system_prompt.md,单镜头用 prompts/short_story_writer_system_prompt.md,把简短想法扩写成规范的镜头描述——不扩写直接喂模型,效果明显偏弱。
效果不达预期时怎么调
| 症状 | 调整 |
|---|---|
| 角色外观或音色前后镜头漂移 | 每个镜头用同一套描述词写角色(服装、发型、音色),别换说法 |
| 画面和文字描述对不上 | 先用增强器把提示词扩写成完整镜头描述,再推理 |
| 显存不够或生成太慢 | 降帧数和分辨率:python inference.py --num-frames 121 --video-height 480 --video-width 832 |
| 多镜头衔接生硬 | 在相邻镜头提示词里补过渡描述,保持场景与时间线连贯 |
先用单镜头、低分辨率把整条流程跑通,确认画面和声音都正常后,再回到默认 1280×736、241 帧出正式片子;提示词记得先过增强器再交给模型。
【免费下载链接】JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。项目地址: https://ai.gitcode.com/jd-opensource/JoyAI-Echo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考