5分钟从主题到成片:Pixelle-Video AI短视频生成工具实操指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一款 AI 短视频生成工具:输入主题,它自动完成文案撰写、AI配图、语音合成、背景音乐与成片合成,直接产出可发布的短视频。适合做科普、Vlog、营销物料的无剪辑经验创作者。
先跑起来:只需完成2项必填配置
Windows 用户可直接用一键整合包,双击start.bat即可;其他系统从源码启动:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video ./start_web.sh启动后浏览器会自动打开http://localhost:8501。首次生成前,展开「系统配置」面板完成两处配置:
- LLM 模型配置:从预设中选通义千问、GPT-4o、DeepSeek 或 Ollama(本地运行),
base_url和model会自动填充,你只填 API Key。 - 图像生成服务:二选一——本地方案填 ComfyUI 地址(默认
http://127.0.0.1:8188)并点「测试连接」;云端方案填 RunningHub API Key,可再设置并发限制(1-10)和实例类型(24GB / 48GB 显存)。
保存后配置写入config.yaml,需要更细的模型参数时直接改这个文件即可。
从主题到成片:5步走完全流程
- 输入主题:左侧「内容输入」选「AI 生成内容」,输入如"健康饮食的重要性";也可选「固定文案」,粘贴完整文案后按段落、行或句子拆分成镜,默认5 个分镜。
- 选语音:中间栏选 TTS 工作流,默认 Edge-TTS 免费即可用;想要自己的声音,上传 MP3/WAV/FLAC 参考音频做声音克隆。
- 选模板与图像参数:在模板画廊里挑视觉风格,确认图像尺寸(默认 1024x1024),默认模板为竖屏
1080x1920/image_default.html。 - 配背景音乐(可选):用内置曲目或上传自定义音乐。
- 点击「生成视频」:界面依次显示生成文案、逐分镜配图、合成语音、合成视频四段进度。5 分镜视频约2-5 分钟,耗时取决于 API 响应与图像生成速度。
完成后右侧直接播放成片,显示时长、文件大小与分镜数,视频文件保存在output/目录。
它能做哪些视频:4类高频场景
| 场景 | 用法要点 | 推荐模板 |
|---|---|---|
| 教育科普 | 输入概念或教程主题,AI 生成结构化解说词 | image_book、image_psychology_card、image_default |
| 个人 Vlog | 上传照片/视频素材,AI 分析后生成解说 | image_healing、image_life_insights |
| 产品推广 | 脚本突出卖点,可多风格试跑对比效果 | image_modern、image_neon |
| 批量内容生产 | 批量模式每行输入一个主题,各生成一条独立视频 | 配合 static_* 模板可压低单条成本 |
批量生产是运营向用户的重点能力,三条经验:
- 先测一条再批量:单条样本确认文案和画面效果后再整批跑;
- 主题分类归组:相近主题一起生成,方便后续统一排期发布;
- 错峰跑批:避开算力与 API 并发高峰,减少失败重试。
让视频更专业的进阶玩法
模板深度定制
所有模板是 HTML 文件,按尺寸存放在 templates/ 目录。做法:复制一个现有模板,改 CSS 调整文字颜色、大小、位置,替换背景图,存回对应尺寸目录即可。模板支持{{ title }}、{{ text }}、{{ image }}三个 Jinja2 变量。命名即类型:static_*.html纯文字渲染(不耗 AI 媒体资源,成本最低),image_*.html需 AI 生成图片,video_*.html需 AI 生成视频。
分辨率与发布平台对应
- 1080x1920 竖屏:抖音、快手、小红书;
- 1920x1080 横屏:B站、YouTube;
- 1080x1080 方形:Instagram、微信朋友圈。
图像尺寸同步跟随平台选择,例如 1024x1024 配小红书、1080x1920 配抖音、1920x1080 配 B站。
ComfyUI 自定义工作流
项目基于 ComfyUI 架构,工作流分 TTS、图像生成、视频生成三类,放在 workflows/ 目录(selfhost/本地、runninghub/云端)。自建流程:在 ComfyUI 里设计工作流 → 导出 JSON → 放入 workflows/ 目录 → 在 Web 界面选中使用。
语音参数调整
解说效果不理想时按顺序试:更换 TTS 工作流(Edge-TTS、Index-TTS、Spark 等)→ 调整语速,0.8-1.2区间最自然 → 换 TTS 服务商 → 用声音克隆获得专属音色。另外,配置中的prompt_prefix提示词前缀能一次性统一整体画面风格。
成本怎么算:3种方案对照
| 方案 | 组合 | 成本特征 | 适合谁 |
|---|---|---|---|
| 本地免费 | Ollama 跑 LLM + ComfyUI 本地出图(需 NVIDIA 显卡,6GB+ 显存)+ Edge-TTS | 零费用 | 有显卡、追求零成本 |
| 云端组合 | 通义千问 + RunningHub 出图/视频 | 按量付费,无硬件维护 | 无显卡用户 |
| 混合搭配 | 重要内容上高质量模型,日常与批量用经济配置 | 灵活可控 | 批量内容生产团队 |
判断口径:本地方案没有单条成本,但机器要常驻且前期搭建重;云端方案即开即用,适合低频或起步用户。建议先用云端跑通流程,再按量替换成本地。
踩坑提示
- 生成失败:先确认网络能访问所用 AI 服务 API;再核对
config.yaml里的 API Key 与服务器地址(ComfyUI 默认端口8188);仍失败则查api_server.log错误信息,重启服务可解决不少偶发问题。 - 图片质量不高:换用 workflows/ 里质量更高的工作流;提示词补"4k, high detail, professional photography"这类质量描述;必要时调整采样步数与 CFG 值。
- 语音不自然:先换 TTS 音色或服务商,再在 0.8-1.2 内微调语速,追求专属音色则上传参考音频做克隆。
Pixelle-Video 的价值在于把文案、素材、配音、合成整条链路压缩成一次「生成」点击,让你只需对主题负责。想深入可看官方文档 docs/zh/:快速开始、模板开发、API 指南。
现在就打开界面,输入一个你真正想发的主题,用默认设置先出一条竖屏视频——拿它当基准,再逐一对比模板和语音参数,会是最快的上手方式。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考