news 2026/8/23 14:46:11

丢进去一句话,3分钟出片:零基础AI视频生成工具Auto-Video-Generator实操

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
丢进去一句话,3分钟出片:零基础AI视频生成工具Auto-Video-Generator实操

丢进去一句话,3分钟出片:零基础AI视频生成工具Auto-Video-Generator实操

【免费下载链接】auto-video-generateor自动视频生成器,给定主题,自动生成解说视频。用户输入主题文字,系统调用大语言模型生成故事或解说的文字,然后进一步调用语音合成接口生成解说的语音,调用文生图接口生成契合文字内容的配图,最后融合语音和配图生成解说视频。项目地址: https://gitcode.com/gh_mirrors/au/auto-video-generateor

想找一台零门槛的AI视频生成工具?Auto-Video-Generator就是干这个的:把一段主题文字丢进去,它自己写好稿、配好音、配上画面,直接出一条带字幕的成片。不用学剪辑,不用碰PR,你只需要会装Python和复制粘贴API密钥。

从零到能跑的AI视频生成服务

先跑起来,再谈优化。整个过程就四步:

git clone https://gitcode.com/gh_mirrors/au/auto-video-generateor cd auto-video-generateor pip install -r requirements.txt

装依赖这一步大概几分钟,其中 moviepy、edge_tts、qianfan 这些包会在后面被流程直接用到。

接下来配密钥。编辑根目录的config.env文件,一共5个API密钥,缺哪个功能就先配哪个:

密钥干什么用
DEEPSEEK_API_KEY生成解说文案,调用DeepSeek接口,几块钱能用很久
DOUBAO_TTS_APPID豆包语音合成的应用ID,给文案配音
DOUBAO_TTS_ACCESS_TOKEN豆包语音合成的令牌,配合上一项使用
QIANFAN_ACCESS_KEY百度千帆的访问密钥,文生图走它
QIANFAN_SECRET_KEY百度千帆的密钥,配合上一项使用
python main.py

启动后浏览器打开 http://127.0.0.1:9020/ ,看到界面就算跑通了。入口逻辑在main.py里,不带参数启动的是默认的第4版界面(免费+校对模式),也支持传参数 1 到 4 切换不同版本。

图:Auto-Video-Generator的AI视频生成参数配置界面,上半部分设主题、图像和语音参数,下半部分是一键生成和各分步按钮

点下"一键生成"后,工具替你干了哪五步

很多人不知道它内部怎么跑,其实就一条流水线,代码都写在auto_video_generateor/video_generateor.py里。

第一步,把主题发给 DeepSeek,让它按你写的提示词模板产出一段口语化的解说文案,前半部分讲清内容核心,后半部分讲案例故事。第二步,用分句逻辑把整段文案切成不超过30字的小段,后面每一句都会独立配一张图、配一段音,所以分句质量直接决定节奏。第三步,每句文案送进语音合成接口(默认豆包TTS,免费版可切 edge-tts),生成一堆 mp3。第四步,每句文案转成画面提示词,调千帆的文生图模型出 1280x720 的配图,图下面还会烧上那句解说文字。第五步,moviepy 把音频和图片按顺序拼成视频轨,再叠上字幕,输出最终的 video.mp4。所有素材按 代号 归档在本地目录里,文本、音频、图片各归各的文件夹,方便你回头单独改。

这条链子上任何一环不满意都可以只重跑那一环,而不是从头再来——这一点下一节细说。

丢主题进去生成,或者把PPT变成视频

如果你是老师,做课程讲解视频最省事:在主题框里写清知识点和教学目标,比如"用3分钟讲清楚蝴蝶效应,面向初中生,配两个真实故事",选个稳重的男声音色,一键生成后把生成的文案过一遍眼,术语不对就在校对界面改文字再重新合成语音,其他资源都不用动。

如果你是做自媒体的,按固定风格批量产片是关键。第一次把图像风格描述、音色、语速调顺之后,点"保存参数"给它起个代号;下一篇同系列内容直接"加载参数",连音色都不用重选,只改主题就行。这个代号机制也方便你把某个项目的全部资源原样调回来继续加工。

图:Auto-Video-Generator的代号管理与资源加载界面,选择代号后一键拉回之前保存的参数和已生成的AI视频素材

如果你手头有现成PPT,还有条更快的路:上传PPT文件,系统把每张幻灯片当画面、把备注栏当逐字稿,直接配音视频化,适合企业内部培训这种"内容已定、只欠表现"的场景。走这条路要额外装 LibreOffice 并配好环境变量,其余步骤一样。

调这几个参数,成片质量差很多

不是参数越多越好,真正值得花时间的就这五个。

主题按"主题+风格+关键元素"写。"讲人工智能"和"讲人工智能发展史,纪录片口吻,包含1956达特茅斯会议和2012年ImageNet两个节点",出片差距非常明显,后者等于提前给文案和配图都定了锚。

音色和语速先试听再定。界面里音色下拉框可以试听,默认的 Yunxi 男声偏讲述感;语速、音量、音调三个滑条放在 50 到 60 之间最稳,拉到边缘容易发闷或发飘。

画面尺寸用 1280x720 就够。这个比例适合B站、抖音横屏,生成速度比 1080p 快一截,先出片再考虑高清。

校对要逐条点"已确认"。一键生成完之后别急着渲染视频,一条条翻:文本改不改、语音听着顺不顺、配图跑没跑偏。只有勾了"已确认"的条目才会真正进片,这一步是成片质量的最大分水岭。

图:Auto-Video-Generator的AI视频生成资源校对界面,左边逐句核对文本与提示词,右边试听语音、预览配图,确认无误后再合成视频

动手前你可能想问的几个问题

需要会编程吗?不需要。界面是 Gradio 做的网页,鼠标能点到的一切就是全部操作,代码你一行都不用看。唯一的门槛是装 Python 依赖和复制粘贴密钥。

五个密钥必须全配吗?不强制。只生成文案加用 edge-tts 配音的话,免费额度就能跑;但文生图默认走千帆,QIANFAN 那两个密钥建议配上,不然配图环节会缺胳膊少腿。

某一张图或某一句配音不满意,要重跑全部吗?不用。在校对界面找到那条资源,取消"已生成"再点一次"已生成",系统只重做这一句的语音或重出这一张图,其余素材原封不动,最后点"已确认"就生效。

一条视频要等多久?取决于文案被切成的句数,每多一句就多一张图加一段音频。短文案通常几分钟,长文案十几分钟起,生成过程中下方资源列表会实时刷新进度,也可以先去干别的,回来用"加载资源"把没生成完的补齐。

main.py 后面带不带参数有什么区别?不带参数进第4版(免费+校对),是目前功能最全的;带 1 是最简版,带 2 是全程基于千帆的版本,带 3 是免费直通版。刚开始玩就默认进4版,别折腾。

把主题丢进去,剩下的交给它

主题想好了吗?装好依赖、配好5个密钥、python main.py 一敲,三分钟后的浏览器里就有一条带解说的成片在等你挑毛病。

【免费下载链接】auto-video-generateor自动视频生成器,给定主题,自动生成解说视频。用户输入主题文字,系统调用大语言模型生成故事或解说的文字,然后进一步调用语音合成接口生成解说的语音,调用文生图接口生成契合文字内容的配图,最后融合语音和配图生成解说视频。项目地址: https://gitcode.com/gh_mirrors/au/auto-video-generateor

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/23 14:45:37

MT Bench 8.12分如何炼成?Starling-LM-7B-beta评测成绩深度解析

MT Bench 8.12分如何炼成?Starling-LM-7B-beta评测成绩深度解析 【免费下载链接】Starling-LM-7B-beta 项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Starling-LM-7B-beta Starling-LM-7B-beta 是由 Nexusflow 团队开源的一款 70 亿参数大语言模…

作者头像 李华
网站建设 2026/8/23 14:42:23

Maka Agent:本地优先AI桌面助手如何重塑你的工作流

Maka Agent:本地优先AI桌面助手如何重塑你的工作流 【免费下载链接】maka Apache Maka (Incubating) is a local-first AI agent workspace. Model messages, tool calls, tool results, permission decisions, and termination events are recorded as an append-o…

作者头像 李华