news 2026/9/8 23:26:19

Pixelle-Video AI短视频生成引擎:零代码、免费本地部署的完整上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Pixelle-Video AI短视频生成引擎:零代码、免费本地部署的完整上手指南

Pixelle-Video AI短视频生成引擎:零代码、免费本地部署的完整上手指南

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

想做一条短视频,往往卡在三件事上:脚本写不出来、素材找不到、配音没人做,一条几分钟的片子折腾一整天。Pixelle-Video 是一个开源的 AI 短视频生成引擎,把这件事简化成一句话——输入一个主题,它自动写解说词、逐句生成配图、合成语音、加上背景音乐,直接输出成片。项目免费开源,可以完全本地部署,不需要会剪辑,也不需要写代码,配好 API 之后几分钟就能产出第一条作品。

一分钟看懂它能做什么

项目说明
一句话定位输入主题,自动生成文案、配图、配音和成片的开源 AI 短视频引擎
核心能力AI 写文案、逐分镜生成配图/视频、多方案 TTS 配音、背景音乐、多尺寸模板、自定义素材、数字人口播、动作迁移
适用人群短视频创作者、教育工作者、企业营销人员、个人博主,以及完全零代码的新手
成本项目开源免费;用 Ollama 本地模型 + 本地 ComfyUI 可零 API 费用跑通全流程,也可选云端 API
硬件要求走云端服务的话一台普通电脑即可;本地跑图像生成建议用支持 CUDA 的 NVIDIA 显卡

5分钟跑起来 🚀

第 1 步:准备环境(做什么 → 看到什么)

  • Windows 用户:项目提供一键整合包,无需安装 Python、uv 或 ffmpeg,解压后双击start.bat,浏览器自动打开http://localhost:8501
  • macOS / Linux 用户:先装好uv(Python 包管理器)和ffmpeg(视频处理工具),然后克隆仓库:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video

第 2 步:启动 Web 界面

uv run streamlit run web/app.py

看到这行命令跑起来、浏览器弹出http://localhost:8501的界面,就说明启动成功了。

第 3 步:首次配置(只做一次)

展开界面里的「⚙️ 系统配置」面板:

  • LLM 配置:下拉选一个预设模型(通义千问、GPT、DeepSeek、Ollama 本地模型等),填入 API Key。
  • 图像生成:二选一——本地 ComfyUI 填服务地址(默认http://127.0.0.1:8188),或云端 RunningHub 填 API Key;也可以直连 DashScope、OpenAI、Volcengine ARK、Kling 等模型 API。
  • 点「保存配置」即可,配置项的完整字段可参考 config.example.yaml。

第 4 步:生成第一条视频

在左侧「内容输入」选「AI 生成内容」,输入一个主题,比如"为什么要养成阅读习惯";语音选默认的 Edge-TTS,模板选竖屏的image_default,然后点「🎬 生成视频」。界面会实时显示"生成文案 → 生成配图 → 合成语音 → 合成视频"的进度,完成后右侧自动播放成片,文件保存在output/文件夹。5 分镜的视频大约需要 2-5 分钟,具体看模型响应速度和网络。

一条视频是怎么做出来的 🎬

整条生产链路是"主题 → 文案 → 配图 → 配音 → 成片",每一步都可以换不同的模型:

  1. 主题:支持「AI 生成内容」(只给主题,AI 写稿)和「固定文案内容」(已有现成文案,直接跳过写稿)两种模式。
  2. 文案:由 LLM 完成,支持通义千问、GPT-4o、DeepSeek、Ollama(本地 llama3.2)等预设,任何兼容 OpenAI 接口的模型都能接。文案会被切分成若干分镜,默认 5 个,还可以按段落/行/句子分割。
  3. 配图:每个分镜单独生成一张插图,默认 1024x1024。生成方式有三档:本地 ComfyUI 工作流、RunningHub 云端工作流(默认image_flux.json),或直连 DashScope、OpenAI GPT Image、Seedream 等图像 API。还能用英文"提示词前缀"统一控制整体画风,比如固定成火柴人简笔画风格。
  4. 配音:TTS 工作流自动从 workflows/ 目录扫描,内置 Edge-TTS(默认)、Index-TTS 等方案,支持多语言音色;上传一段参考音频(MP3/WAV/FLAC)还能做声音克隆,先试听再正式生成。
  5. 成片:FFmpeg 把插图、语音和背景音乐合成视频。背景音乐可以选内置曲目,或把自己的 MP3/WAV 放进bgm/文件夹使用。

视觉风格与模板怎么选 🎨

模板是 HTML 文件,决定画面的布局和设计,按尺寸分成三组,下拉菜单里也会按组显示:

尺寸用途代表模板
竖屏 1080x1920抖音、快手、小红书等短视频平台image_defaultimage_modernimage_cartoonimage_life_insightsvideo_healing
横屏 1920x1080YouTube、B站等image_filmimage_bookimage_fullimage_wide_darktech
方形 1080x1080信息流/社交卡片image_minimal_framed

模板的命名规则很直白,看前缀就知道它需要什么素材:

  • static_*.html:静态模板,纯文字样式,不需要AI 生成任何媒体,出片最快;
  • image_*.html:图片模板,用 AI 生成的图片做背景;
  • video_*.html:视频模板,用 AI 生成的动态视频做背景,视觉冲击最强。

选模板时可以点「预览模板」先试效果,还能自定义参数测试;会一点 HTML 的话,可以在 templates/ 目录放自己的模板。全部模板的效果图整理在 模板文档。

不止自动生成

除了"给主题出片"这条主线,Pixelle-Video 还内置了几个进阶流水线(见 web/pipelines/):

  • 自定义素材:上传自己的照片和视频,AI 会分析素材内容,自动生成匹配的脚本和解说,还能按旁白时长生成 API 视频片段,适合把已有素材变成成片。
  • 数字人口播:生成数字人形象来讲解视频,适合教育培训、产品演示这类需要"出镜"的场景。
  • 动作迁移:上传参考视频和图片,把动作迁移到目标素材上,做出独特的动态效果。
  • 图生视频:把静态图片变成动态片段,让画面不再呆板。
  • 多语言与批量:TTS 支持多语言音色,历史记录页还支持批量创建视频任务,一次面向多个语言/版本受众出片。

它是怎么搭起来的

Pixelle-Video 采用分层架构:最上面是 Streamlit Web 层(web/),负责界面和交互;中间是服务层(pixelle_video/services/),核心类PixelleVideoCore协调 LLM 服务、图像服务、TTS 服务、视频生成器这四个子服务;底下是 ComfyUI 层,负责实际的图像、视频和语音推理。

它的关键设计是"原子能力可替换":图像、视频、TTS、素材分析(VLM)每一项都可以独立选择来源——本地 ComfyUI、RunningHub 云端,或直连模型供应商 API,通过 workflows/ 里的 JSON 工作流文件声明(selfhost/放本地工作流,runninghub/放云端工作流)。生成流程本身由 pixelle_video/pipelines/ 里的标准管道、素材驱动管道和自定义管道组织。配置统一用 YAML 管理,技术栈是 Python 3.10+ 加 AsyncIO。更多细节可看 架构文档。

场景选型手册

场景推荐模板语音/音乐建议
科普讲解竖屏image_defaultpsychology_card(心理学卡片风)清晰专业的音色,语速适中;加轻快 BGM 增强学习氛围
产品营销image_modern(竖屏)或image_full(横屏全屏展示)自信有力的音色;音乐节奏偏明快,音量压低不抢人声
个人 Vlog / 生活感悟image_life_insightsvideo_healing(治愈系动态背景)温暖亲切的音色;舒缓 BGM,可用声音克隆保持个人风格
影视解说 / 深度内容横屏image_filmimage_book低沉沉稳的音色;音乐克制,突出旁白

高频问题 ❓

Q:生成一条视频要多久?5 个分镜的视频大约 2-5 分钟,取决于 LLM 响应速度、图像生成方式和网络状况。分镜越多、用动态视频模板,时间越长。

Q:使用要花钱吗?项目本身开源免费。完全免费方案:Ollama 本地跑 LLM + 本地 ComfyUI 生图,全程 0 元;预算有限的折中方案是通义千问(调用成本很低)+ 本地 ComfyUI;全云端方案(OpenAI + RunningHub)费用最高,但不用折腾本地环境。

Q:需要什么硬件?走云端 API 的话,普通电脑即可。本地跑 ComfyUI 生图建议有支持 CUDA 的 NVIDIA 显卡,显存越大出图越快。

Q:输出什么格式,能发哪些平台?支持竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三种尺寸,分别对应抖音/快手/小红书、YouTube/B站、信息流卡片等平台,成片保存在output/文件夹。

Q:效果不满意怎么调?按四个旋钮排查:换 LLM 模型改文案风格 → 调图像尺寸和提示词前缀改配图画风 → 换 TTS 工作流或上传参考音频改声音 → 换模板和尺寸改画面布局。

Q:固定文案能用吗?可以。选「固定文案内容」模式直接贴入现成脚本,跳过 AI 写稿环节,按段落/行/句子切分成分镜。

开始动手

  1. 装好环境(Windows 用整合包,其他系统装 uv + ffmpeg 并克隆仓库);
  2. 启动 Web 界面,在系统配置里填好 LLM 和图像生成的密钥;
  3. 输入一个你真正想讲的主题,选一个竖屏模板,点「生成视频」;
  4. 对不满意的环节,按"文案 → 配图 → 声音 → 模板"的顺序逐项微调;
  5. 之后尝试自定义素材、数字人或批量任务,把工具箱用满。

主题只是起点,剩下的交给 Pixelle-Video——现在就去生成你的第一条 AI 短视频吧。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/8 23:24:57

uncorr. ECC 显示2是什么意思?服务器内存告警排查全流程

我接手过不少说新不新、说老不老的服务器,最怕的不是性能不够,而是安静跑着的机器突然被一条硬件告警打断。有一回巡检,BMC的事件日志里躺着一行字:Uncorrectable ECC Error, DIMM_A2, Event Count 2。当时看到“Uncorrectable”这…

作者头像 李华
网站建设 2026/9/8 23:24:46

散射中心提取程序解析:从雷达回波到目标特征的关键技术

简介:面向雷达目标识别与成像应用,散射中心提取程序是一套基于MATLAB的信号处理工具包,聚焦从目标回波信号中提取散射中心,可用于雷达成像、目标特征分析与识别,适合雷达信号处理方向的研究者、工程师及高年级学生使用…

作者头像 李华
网站建设 2026/9/8 23:24:06

Drawio 启动屏白屏?5 分钟定位与修复的完整指南

Drawio 启动屏白屏?5 分钟定位与修复的完整指南 【免费下载链接】drawio-desktop Official electron build of draw.io 项目地址: https://gitcode.com/GitHub_Trending/dr/drawio-desktop 双击 Drawio 图标,屏幕转圈十几秒,最后只剩一…

作者头像 李华
网站建设 2026/9/8 23:23:52

Session First还是Agent First?AI产品设计范式的本质与选型指南

1. 两个热词背后的真正分歧最近和几拨做 AI 产品的朋友聊天,发现大家手里都在悄悄押注两条不同的路线:一边是坚持 Session First,把对话窗口当作产品的主战场;另一边是All in Agent First,觉得未来的应用就应该是一堆自…

作者头像 李华