SkyReels-V2 AI视频生成10分钟跑通:文生视频与图生视频完整上手
【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2
SkyReels-V2 是一个 AI 视频生成模型:输入一句文字或一张图片,输出几秒到几十秒的视频,且能借助 Diffusion Forcing(自回归扩散强迫,让每一帧独立处理噪点、再以前一段画面为参考往外续写)把视频续接成更长的长度。本文面向第一次接触视频生成模型的读者,按"先出结果、再讲原理"的顺序带你跑通,全程约 10 分钟。
图里看的是整个技术链路:左侧的 SkyCaptioner 负责给视频打结构化标注,中间是强化学习与 Diffusion Forcing 训练,右侧才是你实际会调到的推理部分。
🏁 安装与第一次生成
这一节解决"装环境 + 出第一条视频"的问题,四步走完。
下载源码到本地:
git clone https://gitcode.com/GitHub_Trending/sk/SkyReels-V2 cd SkyReels-V2安装全部 Python 依赖(基于 Python 3.10 测试,含 flash_attn,需要匹配你的 CUDA 版本):
pip install -r requirements.txt把 1.3B 模型权重放到当前目录(1.3B 版峰值显存约 15GB,14B 版要 50GB 以上,新手先用 1.3B):
pip install -U "huggingface_hub[cli]" huggingface-cli download Skywork/SkyReels-V2-DF-1.3B-540P \ --local-dir ./SkyReels-V2-DF-1.3B-540P用文字生成第一条视频,模型若未下载会自动拉取,成片存进diffusion_forcing/目录:
python3 generate_video_df.py \ --model_id Skywork/SkyReels-V2-DF-1.3B-540P \ --resolution 540P \ --prompt "A duck paddling across a quiet pond at dusk" \ --num_frames 97 --offload📂 看懂目录结构
这一节解决"代码放在哪、各管什么"的问题。
generate_video.py/generate_video_df.py:两个推理入口,前者跑文生/图生视频,后者跑 Diffusion Forcing 长视频。- skyreels_v2_infer/:模型主体。
modules/放注意力、VAE 编解码器和文本编码器;pipelines/是推理流程封装;scheduler/是去噪求解器;distributed/支持多卡加速。 - skycaptioner_v1/:独立的视频打字幕工具,
examples/data/里带了几个可直接试跑的示例视频。
完整的参数表在 README.md 里,本文只挑最常用的几个。
🎥 三种玩法逐个跑
这一节解决"不同任务各用什么命令"的问题。
文生视频:上面第一条命令就是文生视频,--num_frames 257约 10 秒、377约 15 秒、737约 30 秒。
图生视频:同一条命令加--image 图片路径,把静态照片变成视频,效果如下:
python3 generate_video_df.py --model_id Skywork/SkyReels-V2-DF-1.3B-540P \ --resolution 540P --image ./cat.jpg \ --prompt "A cat slowly turning its head, sunlight through the window"续写已有视频:加--video_path 视频路径,输出长度等于原视频长度加新生成的--num_frames,这就是"无限长度"的落地方式。
锁首尾帧:加--image和--end_image分别指定第一帧和最后一帧,中间内容由模型补全。
标准文生视频模型:换入口脚本,用--guidance_scale 6.0 --shift 8.0;图生视频任务建议把这两个值降到 5.0 和 3.0。
⚙️ 参数速查
这一节解决"常用参数设多少"的问题。
| 参数 | 作用 | 推荐值 | 新手建议 |
|---|---|---|---|
--prompt | 视频内容的文字描述 | 一句完整英文长句 | 必写,按下一节结构写 |
--num_frames | 输出总帧数(24fps) | 97 / 257 / 737 | 先用 97,约 4 秒 |
--guidance_scale | 跟随提示词的程度 | 6.0(T2V)/ 5.0(I2V) | 偏高画面易变形,偏低易不听指令 |
--seed | 随机种子 | 任意整数 | 固定后结果可复现 |
--offload | 把模型权重搬回 CPU 省显存 | 建议开启 | 显存紧时一定加 |
✍️ 提示词怎么写
这一节解决"提示词怎么组织效果才稳定"的问题。建议用英文,按"主体 + 环境 + 动作 + 镜头"四要素写成一句完整的话。
- 基础版:
A red fox walking through a snowy forest. - 进阶版:
A red fox with a bushy tail walking through a snowy pine forest at dawn, soft blue fog drifting between the trunks, the camera slowly pushes in from a low angle.
进阶版比基础版多了光线、雾、机位和运镜四个信息点,画面会更贴合你的意图。
🩹 翻车自救与硬件建议
这一节解决"跑挂了怎么办、显卡要什么配置"的问题。
显存爆了:换 1.3B 模型并加--offload,或把--base_num_frames从 97 降到 77 / 57 压峰值显存,代价是画质略降。
长视频越往后越糊:加--addnoise_condition 20,给历史参考帧补一点噪来平滑过渡;数值超过 50 反而会引起不一致。
画面变形或完全不听提示词:--guidance_scale太高就降、太低就升,从 5.0 到 7.0 之间试。
硬件两档:入门档 16GB 显存显卡,跑 1.3B +--offload;进阶档 50GB 以上显存,跑 14B 模型,多卡可用torchrun加--use_usp加速。
🧭 下一步往哪走
跑通之后,试着把--num_frames调到 377、737 生成更长的片子,换几组--seed找稳定配方;想深入的话,skyreels_v2_infer/modules/ 里的transformer.py与scheduler/是最值得读的两处。
【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考