lanshu-create-ai-presenter-video完整介绍:一个脚本加一张照片,如何做出可验证发布的AI数字人讲解视频
【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video
lanshu-create-ai-presenter-video是一个 AI 数字人讲解视频制作工具(Agent Skill):只需提供一个主题或一段文案,再加一张已授权的人物照片,就能让 AI agent 自动完成配音、数字人出镜、口型同步、字幕、剪辑、渲染和质量验收,产出一条可直接发布的讲解视频;也可以不出现真人,改用九种视觉风格把内容"演"出来。
🎬 一句话说明它是什么
这是一个"provider 中立"的制作流程:你不绑定某个特定平台,而是把视频生产的完整工作流交给手里正在用的 AI agent(Claude Code、Codex、Cursor、Gemini CLI 等都支持)。它负责三件难事:
- 全流程自动化:从文案 → 配音 → 数字人生成 → 剪辑 → 渲染 → 交付,每个阶段都有脚本和检查点
- 可验证交付:成片必须通过完整解码和响度检查,状态由磁盘上的产物计算得出,不能"口头宣称完成"
- 成本护栏:先做低成本试片、付费前明确报价、任务中断凭 ID 恢复,避免重复扣费
🧭 两条路线:数字人出镜,或九种风格"演绎"
| 路线 | 成片效果 | 你需要提供 | 付费项 | 画幅 |
|---|---|---|---|---|
| 数字人讲解 | AI 数字人出镜口播,字幕+关键词动效辅助 | 主题/文案 + 授权人物照片 | 配音 + 数字人视频 | 任意,默认 9:16 竖屏 |
| 风格化讲解 | 不用真人:每句讲解都用画面"演"出来 | 主题/文案(也可自带配音) | 仅配音(自带配音则免费) | 16:9 横屏 |
风格化路线内置九种视觉风格,下图是仓库自带的 KV cache 讲解片在九种风格中的同一时刻,一眼就能看懂每种"味道":
九种风格一览(详见 explainer/STYLES.md):
- V1 留白:暖白纸+墨色+一抹朱红,克制高级,适合商业、产品
- V2 信号:暗色仪表盘+荧光绿数据流,适合 AI、系统、网络类
- V3 手帐:方格纸上真笔现写,适合一步步推导、学习笔记
- V4 立体书:牛皮纸立体书、纸片折起,温暖,适合讲故事
- V5 波普漫画:网点漫画+爆炸字,节奏快,适合观点、辟谣
- V6 一镜到底:3D 影棚电影感,适合重磅概念、发布内容
- V7 图纸与注脚:黑色工程图纸+引线注脚,硬核技术深挖
- V8 黑板报:粉笔现写+结尾脑图,课堂感,适合入门
- V9 黏土小城:萌系黏土小镇用比喻讲概念,适合小白
拿不准选哪种?可以九种风格各出一版草稿(配音锁定后不额外花钱),用九宫格对比图再挑。
⚙️ 核心机制:证据驱动的八阶段流水线
这是该项目与普通"AI 视频生成器"最大的区别——它把视频生产当成一个有验收标准的项目来管理:
intake → content_locked → audio_locked → visual_plan_locked → presenter_generated → composition_checked → rendered → verified- 每个阶段都必须有对应证据(通过的预检报告、可解码的配音、时间轴与分镜、交付报告等)才能进入下一阶段
- 状态由 scripts/check_state.py 根据任务目录里的产物计算得出,不允许手工声明,声明超出证据时会直接报错
- 配音是"主时钟":数字人动作、字幕、剪辑点和成片时长全部对齐锁定后的配音,保证口型与段落边界不漂移
交付环节由 scripts/finalize_delivery.sh 把关:两遍响度归一化(默认 −16 LUFS)、母版/分享版完整解码、黑帧与冻帧检测,全部通过才连同九宫格接触表和交付报告一起发布。
🚀 快速开始:安装与第一条视频
环境要求:Python 3.9+、FFmpeg、Bash、jq;风格化路线另需 Node.js 和 rsync。
第一步:克隆到 Skills 目录(以 Claude Code 为例,目录名需保持与 Skill 名称一致):
git clone https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video.git \ ~/.claude/skills/lanshu-create-ai-presenter-video第二步:用自然语言下达需求。多数 harness 会根据 SKILL.md 中的描述自动选中该 Skill,直接说:
把这份文案和人物照片做成一条 30 秒、16:9、带实时字幕的数字人讲解视频。
或者做风格化讲解:
不要真人,做一个 40 秒讲 RAG 的讲解视频,有哪些风格可以选?
Agent 会自动调用内置脚本完成建任务、预检、配音、生成、渲染。如果你想手动控制,入口脚本包括 scripts/init_job.py(创建自包含任务目录)、scripts/preflight.py(素材与授权预检)、scripts/plan_segments.py(服务商有时长上限时按真实停顿分段),风格化路线工具在 explainer/tools/ 下(story.py 讲稿配音、new_film.sh 生成初稿、qa.py 质检、render.sh 渲染交付)。
一个关键体验:整个过程中,agent 会在首次付费调用前主动告诉你——要上传什么、请求多少秒、已知价格、试片规模、重试上限,确认后才开始花钱。
🛡️ 安全与成本控制细节
- 上传图片前必须确认使用权和人物成年;克隆声音需明确授权,绝不从照片推断声音
- 连续三个付费候选被否决即停止,并给出问题总结和剩余选项
- 远程任务中断后先凭已保存的任务 ID 查询,再考虑重新提交,避免重复扣费
- 仓库不含任何 API 密钥、令牌或用户素材;报告只记录相对路径
- 想零成本试玩?tests/smoke.sh 冒烟测试用合成素材把任务从
intake推到verified,全程不调用任何远程服务
📁 关键路径速查
- 技能入口与工作流:SKILL.md
- 风格选择指南与"按风格写稿"表格:explainer/STYLES.md
- 风格包接口与工具说明:explainer/KITS.md
- 各阶段参考文档(按需加载):references/generation.md、references/editing.md、references/qa-recovery.md、references/styled-explainer.md
- 九种风格的完整示例工程:explainer/examples/kv-cache/
- 中文文档:README.zh-CN.md
✅ 适合谁用
- 想批量产出数字人口播视频(默认 9:16 竖屏,1080×1920)的创作者和团队
- 需要可验收、可复现视频生产流程的开发者:每个任务的产物、服务商选择、任务 ID 都留痕在任务目录里
- 想探索 AI 视频但不想被单一服务商锁死的用户:配音、数字人、口型同步都按能力运行时选型,每个任务记录实际使用的服务商与参数
总结:lanshu-create-ai-presenter-video的价值不在于"多一种生成工具",而在于把"一段文案 + 一张照片"到"可验证发布的成片"之间的每一道关,都变成了有证据、有闸门、有成本的自动化流水线。
【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考