Pixelle-Video:主题到成片的全自动 AI 短视频引擎,从零到上手
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一款输入主题即可自动产出成片的 AI 短视频引擎,覆盖文案、配图、配音、配乐与合成,适合个人创作者和小团队批量出片。项目本身免费(Apache 2.0),LLM 可选本地 Ollama 实现零成本,也可以接通义千问、OpenAI 等云端 API;环境门槛主要是 Python 包管理器 uv 和 ffmpeg。最短路径:clone 仓库 → 跑./start_web.sh→ 在网页里填 API Key → 输一个主题。
从安装到拿到第一个成片
整个过程都在 Web 界面里完成,命令行部分只有两行。
- 克隆仓库并启动:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video,进入目录后执行./start_web.sh(内部就是uv run streamlit run web/app.py,依赖会自动装),浏览器自动打开http://localhost:8501。Windows 用户也可以直接下载整合包双击start.bat,跳过环境准备。 - 系统配置面板(首次必填):
- LLM 配置:写文案用。选预设(通义千问 / GPT-4o / DeepSeek / Ollama)会自动填 base_url 和 model,只需补 API Key;Ollama 走本地
http://localhost:11434/v1,不花钱。 - ComfyUI / RunningHub 配置:出图和出视频的工作流引擎。本地 ComfyUI 默认
http://127.0.0.1:8188,点「测试连接」确认;没显卡就填 RunningHub 的 API Key,runninghub_concurrent_limit默认 1。 - API 媒体模型配置(可选):绕过 ComfyUI 直连 DashScope、OpenAI、ARK、Kling 等供应商,按需填密钥和 Base URL。
- LLM 配置:写文案用。选预设(通义千问 / GPT-4o / DeepSeek / Ollama)会自动填 base_url 和 model,只需补 API Key;Ollama 走本地
- 拿到第一个视频:左侧选「AI 生成内容」,主题写「为什么要养成阅读习惯」这类一句话即可;分镜数默认 5;模板保持默认
1080x1920/image_default.html;TTS 用默认的selfhost/tts_edge.json(免费 Edge-TTS)。点「生成视频」,进度条会依次显示 分镜 x/N → 生成配图 → 合成语音 → 合成视频,产物落在output/目录。
一条管线跑完全程:文案、配图、配音、合成分别由谁做
整条链路在 pixelle_video/pipelines/standard.py 里能一一对应,五步各有分工:
- 文案:
utils/content_generators.py里的generate_narrations_from_topic调 LLM 把主题拆成 N 段旁白(默认 5 段,单段 5~20 字可调);切分粒度支持段落 / 行 / 句子,由split_narration_script处理。想自己写稿就走「固定文案内容」模式,一行一句。 - 配图 prompt:同一工具模块的
generate_image_prompts为每段旁白生成画面描述,再拼上你在界面里设置的prompt_prefix(英文,控制整体画风,比如火柴人简笔画)。 - 出图 / 出视频:由
comfyui.image.default_workflow和comfyui.video.default_workflow指定,默认分别是runninghub/image_flux.json和runninghub/video_wan2.1_fusionx.json;本地则换selfhost/下同名文件。 - 配音:
comfyui.tts.default_workflow指向selfhost/tts_edge.json,换成tts_index2.json可开声音克隆,此时需要上传参考音频(MP3/WAV/FLAC)。 - 合成:
pixelle_video/services/video.py里的 VideoService 用 ffmpeg 把每帧画面按模板 HTML 渲染成段、再拼接,最后叠 BGM(bgm/目录放自定音乐)。
也就是说,每个环节都能单独换后端,互不影响。
模型、模板、部署位置怎么选
| 决策项 | 推荐 | 适用场景 | 关键参数 |
|---|---|---|---|
| LLM | 通义千问 qwen-max | 有中文内容、预算敏感 | base_url 走 dashscope 兼容模式 |
| LLM(零成本) | Ollama 本地 | 有显卡 / 内网环境 | localhost:11434/v1 |
| 图像生成 | RunningHub + FLUX | 无本地显卡 | runninghub/image_flux.json |
| 图像生成(本地) | selfhost FLUX / Qwen | 有 8G+ 显存 | selfhost/image_flux.json |
| 视频片段 | WAN 2.1 | 需要动态背景 | runninghub/video_wan2.1_fusionx.json |
| TTS | Edge-TTS | 免费、多语言 | selfhost/tts_edge.json |
| TTS(克隆) | Index-TTS | 想要个人音色 | selfhost/tts_index2.json+ 参考音频 |
模板按文件名前缀分三类:static_*(纯文字不出图,最省)、image_*(配 AI 图)、video_*(配 AI 视频,最贵)。竖屏看templates/1080x1920/,横屏看1920x1080/,方形看1080x1080/。默认default_template写在config.yaml,也可以在界面上直接切换并预览。
高频坑与排查路径
- 生成卡在「生成配图」不动:先点系统配置里的「测试连接」确认 ComfyUI / RunningHub 可达;再确认对应工作流 JSON 在
workflows/下且能被扫描到;本地 ComfyUI 还要检查模型是否已下载(docs/zh/troubleshooting.md 有对应小节)。 - 文案风格跑偏:换 LLM 或调
n_scenes;分镜数越多单段字数越少,节奏更碎;单段字数上限默认 20 字,可在参数里放宽。 - 配音不自然:先试听 Edge-TTS 不同音色,再考虑切 Index-TTS 并上传 10 秒以上清晰参考音频;参考音频格式不对是最常见原因。
- 依赖安装失败 / 启动报错:先
uv cache clean再uv sync;确认ffmpeg -version能正常输出,这是合成环节的硬依赖。
进阶入口
- 换画风:改
workflows/selfhost/image_*.json里的 ComfyUI 节点,或直接在界面里加prompt_prefix。 - 加模板:往
templates/1080x1920/放一个 HTML,遵循static_/image_/video_前缀约定即可被扫描到。 - 批量出片:内容输入区切「批量模式」,一行一个主题,共用同一套模板与分镜数。
- 扩展能力:
pixelle_video/pipelines/下已有 digital_human、i2v、asset_based 等独立管线,可作为二次开发模板。 - 文档站:docs/zh/ 有模板、配置 schema、语音克隆等更细的章节。
跑通第一个视频后,把 LLM 换成更稳的模型、TTS 换成 Index-TTS 克隆音色、模板换成video_healing这类带动态背景的,基本就是一套可长期用的日常出片配置。想深入看代码,从 pixelle_video/service.py 的调度入口开始读,管线细节看 pixelle_video/pipelines/,工作流示例看 workflows/。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考