Pixelle-Video AI短视频生成引擎:零代码、免费本地部署的完整上手指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
想做一条短视频,往往卡在三件事上:脚本写不出来、素材找不到、配音没人做,一条几分钟的片子折腾一整天。Pixelle-Video 是一个开源的 AI 短视频生成引擎,把这件事简化成一句话——输入一个主题,它自动写解说词、逐句生成配图、合成语音、加上背景音乐,直接输出成片。项目免费开源,可以完全本地部署,不需要会剪辑,也不需要写代码,配好 API 之后几分钟就能产出第一条作品。
一分钟看懂它能做什么
| 项目 | 说明 |
|---|---|
| 一句话定位 | 输入主题,自动生成文案、配图、配音和成片的开源 AI 短视频引擎 |
| 核心能力 | AI 写文案、逐分镜生成配图/视频、多方案 TTS 配音、背景音乐、多尺寸模板、自定义素材、数字人口播、动作迁移 |
| 适用人群 | 短视频创作者、教育工作者、企业营销人员、个人博主,以及完全零代码的新手 |
| 成本 | 项目开源免费;用 Ollama 本地模型 + 本地 ComfyUI 可零 API 费用跑通全流程,也可选云端 API |
| 硬件要求 | 走云端服务的话一台普通电脑即可;本地跑图像生成建议用支持 CUDA 的 NVIDIA 显卡 |
5分钟跑起来 🚀
第 1 步:准备环境(做什么 → 看到什么)
- Windows 用户:项目提供一键整合包,无需安装 Python、uv 或 ffmpeg,解压后双击
start.bat,浏览器自动打开http://localhost:8501。 - macOS / Linux 用户:先装好
uv(Python 包管理器)和ffmpeg(视频处理工具),然后克隆仓库:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video第 2 步:启动 Web 界面
uv run streamlit run web/app.py看到这行命令跑起来、浏览器弹出http://localhost:8501的界面,就说明启动成功了。
第 3 步:首次配置(只做一次)
展开界面里的「⚙️ 系统配置」面板:
- LLM 配置:下拉选一个预设模型(通义千问、GPT、DeepSeek、Ollama 本地模型等),填入 API Key。
- 图像生成:二选一——本地 ComfyUI 填服务地址(默认
http://127.0.0.1:8188),或云端 RunningHub 填 API Key;也可以直连 DashScope、OpenAI、Volcengine ARK、Kling 等模型 API。 - 点「保存配置」即可,配置项的完整字段可参考 config.example.yaml。
第 4 步:生成第一条视频
在左侧「内容输入」选「AI 生成内容」,输入一个主题,比如"为什么要养成阅读习惯";语音选默认的 Edge-TTS,模板选竖屏的image_default,然后点「🎬 生成视频」。界面会实时显示"生成文案 → 生成配图 → 合成语音 → 合成视频"的进度,完成后右侧自动播放成片,文件保存在output/文件夹。5 分镜的视频大约需要 2-5 分钟,具体看模型响应速度和网络。
一条视频是怎么做出来的 🎬
整条生产链路是"主题 → 文案 → 配图 → 配音 → 成片",每一步都可以换不同的模型:
- 主题:支持「AI 生成内容」(只给主题,AI 写稿)和「固定文案内容」(已有现成文案,直接跳过写稿)两种模式。
- 文案:由 LLM 完成,支持通义千问、GPT-4o、DeepSeek、Ollama(本地 llama3.2)等预设,任何兼容 OpenAI 接口的模型都能接。文案会被切分成若干分镜,默认 5 个,还可以按段落/行/句子分割。
- 配图:每个分镜单独生成一张插图,默认 1024x1024。生成方式有三档:本地 ComfyUI 工作流、RunningHub 云端工作流(默认
image_flux.json),或直连 DashScope、OpenAI GPT Image、Seedream 等图像 API。还能用英文"提示词前缀"统一控制整体画风,比如固定成火柴人简笔画风格。 - 配音:TTS 工作流自动从 workflows/ 目录扫描,内置 Edge-TTS(默认)、Index-TTS 等方案,支持多语言音色;上传一段参考音频(MP3/WAV/FLAC)还能做声音克隆,先试听再正式生成。
- 成片:FFmpeg 把插图、语音和背景音乐合成视频。背景音乐可以选内置曲目,或把自己的 MP3/WAV 放进
bgm/文件夹使用。
视觉风格与模板怎么选 🎨
模板是 HTML 文件,决定画面的布局和设计,按尺寸分成三组,下拉菜单里也会按组显示:
| 尺寸 | 用途 | 代表模板 |
|---|---|---|
| 竖屏 1080x1920 | 抖音、快手、小红书等短视频平台 | image_default、image_modern、image_cartoon、image_life_insights、video_healing |
| 横屏 1920x1080 | YouTube、B站等 | image_film、image_book、image_full、image_wide_darktech |
| 方形 1080x1080 | 信息流/社交卡片 | image_minimal_framed |
模板的命名规则很直白,看前缀就知道它需要什么素材:
static_*.html:静态模板,纯文字样式,不需要AI 生成任何媒体,出片最快;image_*.html:图片模板,用 AI 生成的图片做背景;video_*.html:视频模板,用 AI 生成的动态视频做背景,视觉冲击最强。
选模板时可以点「预览模板」先试效果,还能自定义参数测试;会一点 HTML 的话,可以在 templates/ 目录放自己的模板。全部模板的效果图整理在 模板文档。
不止自动生成
除了"给主题出片"这条主线,Pixelle-Video 还内置了几个进阶流水线(见 web/pipelines/):
- 自定义素材:上传自己的照片和视频,AI 会分析素材内容,自动生成匹配的脚本和解说,还能按旁白时长生成 API 视频片段,适合把已有素材变成成片。
- 数字人口播:生成数字人形象来讲解视频,适合教育培训、产品演示这类需要"出镜"的场景。
- 动作迁移:上传参考视频和图片,把动作迁移到目标素材上,做出独特的动态效果。
- 图生视频:把静态图片变成动态片段,让画面不再呆板。
- 多语言与批量:TTS 支持多语言音色,历史记录页还支持批量创建视频任务,一次面向多个语言/版本受众出片。
它是怎么搭起来的
Pixelle-Video 采用分层架构:最上面是 Streamlit Web 层(web/),负责界面和交互;中间是服务层(pixelle_video/services/),核心类PixelleVideoCore协调 LLM 服务、图像服务、TTS 服务、视频生成器这四个子服务;底下是 ComfyUI 层,负责实际的图像、视频和语音推理。
它的关键设计是"原子能力可替换":图像、视频、TTS、素材分析(VLM)每一项都可以独立选择来源——本地 ComfyUI、RunningHub 云端,或直连模型供应商 API,通过 workflows/ 里的 JSON 工作流文件声明(selfhost/放本地工作流,runninghub/放云端工作流)。生成流程本身由 pixelle_video/pipelines/ 里的标准管道、素材驱动管道和自定义管道组织。配置统一用 YAML 管理,技术栈是 Python 3.10+ 加 AsyncIO。更多细节可看 架构文档。
场景选型手册
| 场景 | 推荐模板 | 语音/音乐建议 |
|---|---|---|
| 科普讲解 | 竖屏image_default或psychology_card(心理学卡片风) | 清晰专业的音色,语速适中;加轻快 BGM 增强学习氛围 |
| 产品营销 | image_modern(竖屏)或image_full(横屏全屏展示) | 自信有力的音色;音乐节奏偏明快,音量压低不抢人声 |
| 个人 Vlog / 生活感悟 | image_life_insights、video_healing(治愈系动态背景) | 温暖亲切的音色;舒缓 BGM,可用声音克隆保持个人风格 |
| 影视解说 / 深度内容 | 横屏image_film、image_book | 低沉沉稳的音色;音乐克制,突出旁白 |
高频问题 ❓
Q:生成一条视频要多久?5 个分镜的视频大约 2-5 分钟,取决于 LLM 响应速度、图像生成方式和网络状况。分镜越多、用动态视频模板,时间越长。
Q:使用要花钱吗?项目本身开源免费。完全免费方案:Ollama 本地跑 LLM + 本地 ComfyUI 生图,全程 0 元;预算有限的折中方案是通义千问(调用成本很低)+ 本地 ComfyUI;全云端方案(OpenAI + RunningHub)费用最高,但不用折腾本地环境。
Q:需要什么硬件?走云端 API 的话,普通电脑即可。本地跑 ComfyUI 生图建议有支持 CUDA 的 NVIDIA 显卡,显存越大出图越快。
Q:输出什么格式,能发哪些平台?支持竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三种尺寸,分别对应抖音/快手/小红书、YouTube/B站、信息流卡片等平台,成片保存在output/文件夹。
Q:效果不满意怎么调?按四个旋钮排查:换 LLM 模型改文案风格 → 调图像尺寸和提示词前缀改配图画风 → 换 TTS 工作流或上传参考音频改声音 → 换模板和尺寸改画面布局。
Q:固定文案能用吗?可以。选「固定文案内容」模式直接贴入现成脚本,跳过 AI 写稿环节,按段落/行/句子切分成分镜。
开始动手
- 装好环境(Windows 用整合包,其他系统装 uv + ffmpeg 并克隆仓库);
- 启动 Web 界面,在系统配置里填好 LLM 和图像生成的密钥;
- 输入一个你真正想讲的主题,选一个竖屏模板,点「生成视频」;
- 对不满意的环节,按"文案 → 配图 → 声音 → 模板"的顺序逐项微调;
- 之后尝试自定义素材、数字人或批量任务,把工具箱用满。
主题只是起点,剩下的交给 Pixelle-Video——现在就去生成你的第一条 AI 短视频吧。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考