Stability AI生成模型:3步跑通出图
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
你是不是也经历过:Stability AI 的 generative-models 仓库 clone 下来,权重下不全,跑一行报一行错,折腾半天没见到一张图。照着下面的 3 大步走(环境、权重、跑通 3 个模型),从空环境到出图出视频,控制在 30 分钟以内。
定位部署时的常见坑
- 报错
ModuleNotFoundError: No module named 'sgm'→ 根因:没激活虚拟环境或没执行pip3 install .安装本仓库的sgm包。 - 模型加载时找不到文件 / Missing key→ 根因:权重文件名或存放位置与
checkpoints/约定不符,配置文件是按精确文件名读的。 CUDA out of memory→ 根因:视频模型默认一次解码全部帧,帧数越多显存吃得越狠。triton==2.0.0安装失败→ 根因:Python 不是 3.10 或 CUDA 版本对不上,依赖链里 triton 锁死了版本。- 反复下载中断→ 根因:直连 Hugging Face 网络不稳,且没做断点续传或镜像。
动手前检查环境与磁盘
对照这张清单确认 4 项即可:
| 检查项 | 要求 | 一条验证命令 |
|---|---|---|
| Python | 3.10 | python3.10 --version |
| CUDA | 11.8 及以上 | nvidia-smi看右上角版本 |
| 磁盘空间 | 权重共约 30GB,建议留 50GB | df -h . |
| pip 源可达 | 能装 torch | pip3 download --no-deps -d /tmp/pipcheck torch |
任何一项不满足先补齐,后面步骤才能一路绿灯。
从环境搭建到 4D 视频生成
第一步:clone 仓库
git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models预期看到:目录里有sgm/、configs/、scripts/、main.py。没看到就ls确认当前目录,clone 报错就看是网络还是权限问题。
第二步:搭 Python 环境(约 10 分钟)
python3.10 -m venv .pt2 source .pt2/bin/activate# 装 CUDA 11.8 对应的 PyTorch pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118pip3 install -r requirements/pt2.txt pip3 install .预期看到:最后一条输出Successfully installed sgm-...。如果triton或xformers报错,别慌,九成是 Python 版本不是 3.10,重建环境重来比逐个修依赖快。
第三步:下载 3 个权重放进checkpoints/
先装上命令行工具,再按模型逐个拉。注意--local-dir checkpoints会把文件直接放进仓库根目录下的checkpoints/:
pip install -U "huggingface_hub[cli]" huggingface-cli download stabilityai/sdxl-turbo sd_xl_turbo_1.0.safetensors --local-dir checkpointshuggingface-cli download stabilityai/stable-video-diffusion-img2vid svd.safetensors --local-dir checkpoints huggingface-cli download stabilityai/sv4d2.0 sv4d2.safetensors --local-dir checkpoints预期看到:ls checkpoints/列出sd_xl_turbo_1.0.safetensors、svd.safetensors、sv4d2.safetensors三个文件。数量或名字对不上就别往下走,先核对文件名。
第四步:跑通文生图
streamlit run scripts/demo/turbo.py预期看到:浏览器自动打开 SDXL-Turbo 页面,输入 prompt 后几秒出 512x512 的图。没出图多半是权重名不对,检查第三步的文件是否叫sd_xl_turbo_1.0.safetensors。
第五步:跑通图生视频
仓库自带的assets/test_image.png可以直接当输入,不用自己找图:
python scripts/sampling/simple_video_sample.py --input_path assets/test_image.png --version svd --output_folder outputs/svd预期看到:终端跑完采样后,outputs/svd/里多了000000.mp4。中途 OOM 就加--decoding_t=4(默认 14)。
第六步:跑通 4D 生成
SV4D 2.0 输入一段 21 帧的视频,输出多视角新视角视频:
python scripts/sampling/simple_video_sample_4d2.py --input_path assets/sv4d_videos/camel.gif --output_folder outputs预期看到:outputs/下生成一个 mp4。低显存(24GB 以下)加--encoding_t=1 --decoding_t=1,显存还紧张再降--img_size=512。
加速下载与批量拉权重
如果你直连下载速度跑不满带宽,可以试试切到国内镜像再重跑同一条命令:
export HF_ENDPOINT=https://hf-mirror.com如果你后面还要陆续补 SVD-XT、SV3D 这些权重,可以改用 Python 按仓库整包拉,省去一条条敲:
from huggingface_hub import snapshot_download snapshot_download("stabilityai/stable-video-diffusion-img2vid-xt", local_dir="./checkpoints")高频故障急救表
| 症状 | 最常见原因 | 一条修复 |
|---|---|---|
ModuleNotFoundError: No module named 'sgm' | 环境没激活或没装仓库本身 | source .pt2/bin/activate && pip3 install . |
CUDA out of memory | 一次解码帧数太多 | 采样命令加--decoding_t=1 |
FileNotFoundError/ Missing key | 权重文件名与配置不符 | ls checkpoints/对照第三步核对文件名 |
triton==2.0.0装不上 | Python 不是 3.10 | 用python3.10重建 venv |
警告not divisible by 64 | 输入图尺寸不是 64 倍数 | 脚本会自动 resize,忽略即可 |
30 秒验证部署成功
两条命令确认权重完整、产出存在:
ls outputs/svd/ python -c "from safetensors.torch import load_file; print(len(load_file('checkpoints/svd.safetensors')))"预期看到:第一条列出000000.jpg和000000.mp4,第二条打印一个上千的整数(张量个数)。两个都对,说明环境、权重、推理链路全部打通。
跑通这三条线后,你可以顺着configs/里的 yaml 改采样步数和引导强度,或者用python main.py --base configs/example_training/toy/mnist_cond.yaml体验一下它自带的训练流程。
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考