如何用lanshu-create-ai-presenter-video:「数字人口播」vs「9种风格动画讲解」双路线选择指南
【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video
lanshu-create-ai-presenter-video 是一个面向新手的开源 Agent Skill:把一句话主题或一份文案交给 AI,就能产出经过验收、可直接发布的讲解视频。它内置两条路线——「数字人口播」(用授权人物图生成真人出镜的口播视频)与「9种风格动画讲解」(不用真人,用动画把内容演出来)。本文帮你快速看懂两条路线的差异,并给出选型清单和上手步骤。🎬
一张表看懂两条路线:选口播还是选动画?
| 对比维度 | 数字人口播 | 9种风格动画讲解 |
|---|---|---|
| 成片样子 | 真人出镜讲解,字幕 + 关键词动效辅助 | 无真人,每一句讲解都用画面「演」出来 |
| 你需要提供 | 主题或文案 +一张授权人物图 | 主题或文案(也可用你自己录好的配音) |
| 付费点 | 配音 + 数字人视频生成 | 仅配音(自带配音则 0 额外费用) |
| 默认画幅 | 任意,默认 9:16 竖屏 | 固定 16:9 横屏 |
| 适合场景 | 个人品牌、对镜头说话 | 概念需要被「演」出来、无真人出镜 |
小提示:如果你还没有一张已授权的人物照片,或内容是抽象概念(缓存、网络、算法流程),优先选动画讲解路线。📌
9种动画讲解风格:先看图再选
上图是仓库自带的 KV cache 讲解片在 9 种风格里的同一时刻。九种风格共用一套接口(逐字字幕、章节条、结尾金句、一帧复习图),区别在于「用什么画面演内容」。完整风格菜单见 explainer/STYLES.md:
| 风格 | 一句话画面 | 最适合 |
|---|---|---|
| V1 留白 | 暖白纸、墨色、一抹朱红 | 商务、产品、严肃话题 |
| V2 信号 | 暗色仪表盘、荧光绿数据流 | AI、系统、网络类 |
| V3 手帐 | 方格纸真笔现写、便利贴 | 一步步推导、学习笔记 |
| V4 立体书 | 牛皮纸立体书、纸片折起 | 讲故事、讲流程 |
| V5 波普漫画 | 网点漫画、贴纸拍入、爆炸字 | 观点、辟谣、快节奏 |
| V6 一镜到底 | 3D 影棚一镜到底、有电影感 | 大概念、重磅发布 |
| V7 图纸与注脚 | 黑色工程图纸、引线、注脚 | 硬核技术深挖 |
| V8 黑板报 | 粉笔现写、结尾粉笔脑图 | 课堂感、入门、易记忆 |
| V9 黏土小城 | 萌系黏土小镇、比喻 + 术语标签 | 用比喻讲给小白 |
拿不准选哪个?工具支持一次出 9 种草稿再对比挑选,音频锁定后不产生额外付费调用。🎨
路线一:数字人口播视频怎么做?
适合你:有个人 IP、想「人对人」讲解,且能提供一张清晰的成年授权人物图。
准备工作
- 一张授权人物图(务必确认使用权,上传前工具会二次校验);
- 主题或完整文案(主题会被写成 45–75 秒文案);
- 可选:声音样本(需明确授权才能克隆,否则自动选用库存声音)。
制作流程(由 SKILL.md 驱动,每个阶段以磁盘上的产物为证据):
主题/文案 + 授权人物图 → 锁定文案与完整配音(配音成为全片时钟) → 低成本人物试片 → 生成数字人素材(服务商有时长上限时按真实停顿自动分段) → 按音频时间轴剪辑:字幕、关键词动效、封面、结尾 → 技术验收 + 画面验收 → 母版、分享版、九宫格与交付报告阶段细节参考 references/generation.md(文案、配音、付费闸门)与 references/editing.md(时间轴、字幕、开场结尾)。
路线二:9种风格动画讲解怎么做?
适合你:没有真人图、或内容靠画面「演」才讲得清(缓存、流程、算法、辟谣等)。
准备工作
- 主题或文案;
- 一个 MiniMax API Key(用于逐句配音与逐字时间戳),或你自己在别处录好的配音(
story.py --audio直接用,0 配音成本)。
制作流程(完整文档见 references/styled-explainer.md):
# 1. 建任务并指定风格(此处以黑板报为例) python3 "$SKILL_DIR/scripts/init_job.py" --job-dir . --route styled \ --explainer-style v8-chalkboard --topic "40 秒讲清楚 RAG" # 2. 讲稿 → 逐句配音 + 逐字时间 → story.json python3 "$SKILL_DIR/explainer/tools/story.py" story # 3. 用风格起步模板出可完整播放的初稿,再逐句演绎 bash "$SKILL_DIR/explainer/tools/new_film.sh" v8-chalkboard story film # 4. 验收(检查、静止检测、封面)→ 5. 渲染出母版/分享版/字幕 python3 "$SKILL_DIR/explainer/tools/qa.py" film qa/film bash "$SKILL_DIR/explainer/tools/render.sh" film rag outputs💡 关键技巧:先选风格再定稿。每种风格擅长的句式、语速、复习页时长都不同,讲稿要按风格来写,详见 explainer/STYLES.md 的「按风格写稿」表。
三步帮你定路线(决策清单)
- 有没有一张已授权的清晰人物图?没有 → 直接走动画讲解(数字人口播没有人物图无法启动)。
- 要竖屏发抖音/小红书,还是横屏发 B 站/YouTube?要 9:16 竖屏 → 走数字人口播;动画讲解目前固定 16:9 横屏。
- 内容靠「人讲」还是靠「画面演」?个人品牌、对镜头说话 →口播;抽象概念、流程、需要可视化 →动画讲解。
安装与运行环境
仓库目录本身就是一个 Skill,克隆到所用工具的 skills 目录即可(目录名保持lanshu-create-ai-presenter-video):
git clone https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video \ ~/.claude/skills/lanshu-create-ai-presenter-video环境要求
- 基础:Python 3.9+、FFmpeg(含
ffprobe)、Bash、jq; - 数字人口播:任一可调用「配音 + 数字人视频 + 口型同步」的能力(云 CLI、API 或本地模型均可);
- 动画讲解:另需 Node.js(
npx运行 HyperFrames)、rsync、带numpy的 Python,以及 MiniMax API Key(或用自带配音)。
成本与交付:钱花在哪,质量怎么保证
- 付费点透明:数字人口播路线首次付费前,agent 会先报「上传内容 + 请求秒数 + 已知价格 + 试片规模 + 重试上限」;动画路线唯一付费项是配音,且逐句缓存,改一句只重配那一句。
- 证据驱动的阶段闸门:任务从
intake到verified共 8 个阶段,状态由 scripts/check_state.py 依据磁盘产物计算得出,而不是手工声明——证据不足就无法前进。 - 交付前强校验:母版与分享版先做完整解码、响度达标(默认 −16 LUFS)、黑帧/冻帧检查,全部通过才发布,避免「看起来完成」的假交付。✅
延伸阅读
- 技能入口与完整工作流:SKILL.md
- 风格菜单与效果图:explainer/STYLES.md
- 风格包接口与工具:explainer/KITS.md
- 口播路线生成与剪辑:references/generation.md、references/editing.md
- 动画路线完整流程:references/styled-explainer.md
- 验收与故障修复:references/qa-recovery.md
一句话总结:有人物图、要竖屏、讲个人 → 数字人口播;没人物图、要横屏、内容要「演」 → 9种风格动画讲解。选定路线后,剩下的交给工具链一步步验收即可。🚀
【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考