Pixelle-Video 指南:如何从一个主题自动生成完整短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一款开源的 AI 全自动短视频引擎:输入一个主题,它自动完成文案撰写、AI 配图、语音合成、背景音乐添加和视频合成五道工序,几分钟内输出一条可直接发布的成品短视频。项目采用 Apache 2.0 协议,本地部署方案可以做到零成本运行。
一句话主题到成片,中间发生了什么
很多人以为这类工具只是"把文字念出来配上图片",Pixelle-Video 的实际流程比这完整得多。整条流水线分为四步:
- 文案生成:LLM 根据主题写出解说词,并按分镜(一段解说对应一个画面)拆分
- 配图规划:为每个分镜生成 AI 图片,或直接用 AI 视频模型(如 WAN 2.1)生成动态背景
- 逐帧处理:把文案、配图、模板排版渲染成帧画面
- 视频合成:叠加语音解说与 BGM,用 ffmpeg 合成最终 MP4,保存到
output/文件夹
生成过程中 Web 界面会实时显示当前步骤,例如"分镜 3/5 - 生成插图"。按官方快速开始文档的说明,生成一个 5 分镜的视频大约需要 2-5 分钟,具体取决于 API 响应速度和图像生成速度。
两种输入方式
- AI 生成内容:只输入主题(如"为什么要养成阅读习惯"),文案由 AI 创作
- 固定文案内容:粘贴现成脚本,还支持按段落、按行、按句子三种方式拆分成分镜,适合已有稿件的场景
核心能力:四个可替换的 AI 环节
Pixelle-Video 把文案、图像、语音、视频四类能力拆成可独立替换的模块,你可以按自己的硬件条件混搭。
各环节支持的选项
| 环节 | 可选方案 |
|---|---|
| 文案(LLM) | 通义千问、GPT-4o、DeepSeek,或本地 Ollama |
| 图像 | 本地 ComfyUI 工作流、RunningHub 云端、直连 DashScope / OpenAI / Seedream 等 API |
| 视频片段 | WAN 2.1、Kling、Seedance 等工作流或直连 API 模型 |
| 语音(TTS) | Edge-TTS、Index-TTS(支持声音克隆)等多语言音色 |
这种设计的好处是:有显卡就全本地跑,没显卡就全走云端,甚至图文走云端、语音走本地也行。所有工作流都是 workflows/ 目录下的 JSON 文件,分selfhost/(本地)和runninghub/(云端)两组,放一个新的 JSON 进去,Web 界面的下拉菜单就会出现新选项。
三条扩展流水线
除了标准流水线,仓库的web/pipelines/下还内置了三条扩展流水线,对应最近几个版本的更新记录:
- 数字人口播(digital_human):生成虚拟人物讲解视频,示例包括韩语口播
- 图生视频(i2v):静态图片转动态片段
- 动作迁移(action_transfer):上传参考视频和图片,把动作迁移到新内容上
此外还有自定义素材模式:上传自己的照片和视频,AI 分析后生成匹配脚本;历史记录页面支持批量创建视频任务。
一条命令启动本地 Web 界面
前置条件
源码方式运行只需两样东西:Python 包管理器uv和ffmpeg。Windows 用户也可以直接用官方的"一键整合包",里面已含全部依赖,解压后双击start.bat即可,无需安装任何环境。
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501。项目也提供了 Dockerfile 和 docker-compose.yml,容器用户按 docs/ 中的说明部署即可。
首次配置的三组密钥
界面是三栏布局:左侧内容输入、中间语音与视觉设置、右侧生成与预览。首次使用需展开"系统配置"面板:
- LLM:下拉选预设模型(如通义千问),自动填充 base_url 和 model,填入 API Key
- 媒体生成:填本地 ComfyUI 地址(默认
http://127.0.0.1:8188)并点"测试连接",或填 RunningHub API Key;直连供应商时再配 OpenAI、DashScope、ARK、Kling 的密钥 - 模板:默认是
1080x1920/image_default.html
完整配置项可参考 config.example.yaml,其中还包括 RunningHub 并发限制(1-10)和提示词前缀(prompt_prefix,用来统一控制配图画风)等可调参数。
竖屏、横屏、方形:三种尺寸的模板怎么选
模板是这套系统的另一个核心。templates/ 目录按尺寸分了三个文件夹,模板文件用 HTML 写画面排版,配合 Jinja2 变量({{ title }}、{{ text }}、{{ image }})注入内容。
| 尺寸 | 模板数量 | 适配平台 |
|---|---|---|
| 1080x1920 竖屏 | 20+ | 抖音、快手、小红书 |
| 1920x1080 横屏 | 5 | YouTube、B站 |
| 1080x1080 方形 | 1 | Instagram、微信朋友圈 |
从文件名判断模板类型
命名规则直接告诉你它需要什么资源:
static_*.html:静态模板,纯文字排版,不需要任何 AI 生成服务,速度最快,新手可以零配置先跑通image_*.html:图片模板,每个分镜需要 AI 生成一张配图video_*.html:视频模板,需要 AI 视频模型生成动态背景,效果最重但耗时也最长
竖屏模板风格覆盖较全:卡通、治愈、电影感、图书解读、养生科普、霓虹、极简黑底、80 年代讽刺漫画等,Web 界面里可以点"预览模板"自定义参数测试效果。想自己加模板,照 docs/zh/user-guide/templates.md 里给的 HTML 示例改个样式、放进对应尺寸目录就行。
进阶玩法:声音克隆、BGM 与成本控制
声音克隆与背景音乐
- 选择支持声音克隆的 TTS 工作流(如 Index-TTS)后,上传一段参考音频(MP3/WAV/FLAC),生成的解说就会用这个声音朗读,支持上传后直接试听
- BGM 有三档:无 BGM、内置音乐(如 default.mp3)、自定义音乐——把 MP3/WAV 文件丢进
bgm/文件夹即可在界面中试听选用
三档成本方案
官方 FAQ 里给出了明确的费用参考:
| 组合 | 成本 | 说明 |
|---|---|---|
| Ollama 本地 LLM + 本地 ComfyUI | 0 元 | 完全免费,需要显卡 |
| 通义千问 + 本地 ComfyUI | 约 0.01-0.05 元/视频 | 官方推荐,性价比高 |
| OpenAI + RunningHub 云端 | 较高 | 无需本地环境 |
有本地显卡直接上免费方案;没有显卡就用通义千问配本地 ComfyUI 跑配图,成本基本可以忽略。
生成失败或效果不佳时的排查顺序
先确认连接,再调效果
- ComfyUI 连接失败:确认服务已启动、URL 正确(Docker 环境下 Mac/Windows 要用
host.docker.internal:8188),在界面点"测试连接" - LLM 调用失败:核对 API Key 和网络连接,看终端错误提示
- TTS 不稳定:项目曾锁定 edge-tts 版本修复过该问题,更新到最新代码通常能解决
效果不满意时的四个调节旋钮
官方给出的改进路径:换 LLM 模型(文案风格会不同)、改图像尺寸和提示词前缀(换配图画风)、换 TTS 工作流或上传参考音频(换声音)、换模板和尺寸(换版式)。另外注意提示词前缀需要写成英文,不同模型对图像尺寸限制也不同,默认 1024x1024 是安全值。
接下来做什么
- 克隆仓库并按上文命令启动 Web 界面,确认 8501 端口可访问
- 在系统配置面板先填 LLM 密钥,新手可先用 Ollama 本地方案
- 用
static_静态模板 + 一个简单主题跑通第一条视频,验证整条链路 - 需要 AI 配图时再配置 ComfyUI 或 RunningHub,换成
image_模板重新生成 - 深入模板开发或 API 用法,查阅 docs/ 目录下的模板开发指南和 API 文档
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考