- 人工智能
- AI 应用
- AI 写作
- 媒体生成
- 工作流自动化
- 网页爬虫
- 浏览器控制
【免费下载链接】Beav
小红书 AI 运营工作台|小红书采集、评论区下载、素材库、选题、AI写作、小红书全域解决方案,开箱即用,一键安装,小红书AI工作台,自媒体素材库,AI写作+图片自动编排,小红书版OpenClaw、自媒体资产底座+AI工作台,支持小红书图文+小红书评论区下载、小红书AI创作工具、自媒体版WorkBuddy、抖音、小红书爬虫数据采集
口播视频拍完,最怕的就是后期剪辑。Beav 是小红书 AI 运营工作台,内置智能剪口播能力:先把口播录音逐词转录成带时间戳的字幕,再用语义分析识别并自动去掉口头禅、废话和断句,最后自动排版渲染出成片——从导入素材到出片,熟练后 5 分钟就能完成。
智能剪口播的三步流水线
在开始之前,先了解一下整个流程是怎么跑起来的(类型定义见 videoAutoEdit.ts):
转录中 → 就绪 → 自动剪辑中 → 渲染中 → 已导出
transcribing → ready → auto_editing → rendering → exported
你不需要记住这些状态,Beav 会自动推进;但它解释了为什么整个过程可以“5 分钟出成片”——每一步都是全自动串接的。
第一步:逐词转录,给每句话打时间戳
把口播原片(或录音)导入后,Beav 会先做一件事:用 FFmpeg 从视频里无损抽取 16kHz 单声道音频,再交给语音识别模型转录,生成 SRT 字幕。
这一步的核心代码在 media_transcribe.rs:
- 逐词对齐:每个字幕片段都带有
startMs/endMs(毫秒级起止时间),甚至记录每段的置信度,方便后续精准切割; - 多格式输出:默认 SRT,也支持 VTT / TXT / JSON;
- 自动兜底:如果上游没有返回时间戳,会按音频总时长估算生成字幕,保证流程不中断;
- 模型可配置:官方通道默认走
fun-asr,也支持在设置里自行配置转写端点。
转录结果会以“字幕轨”(TranscriptTrack)的形式挂到工程里,为下一步的语义分析做准备。
💡 小技巧:转录用麦克风直录的口播效果最好;如果原片里有背景音乐,建议先让 Beav 抽取纯人声音轨再转录。
第二步:语义分析,自动标记口头禅
这是 Beav 智能剪口播的“灵魂”所在。转录完成后,AI 不会只是把文字摆上来,而是给每一句字幕打上语义标签:
| 标签 | 含义 | 处理方式 |
|---|---|---|
hook | 开头钩子/金句 | 优先保留 |
keep | 有效信息 | 保留 |
highlight | 重点强调句 | 保留并可加字幕强调 |
filler | 口头禅、语气词、废话 | 建议删除 |
unclear | 听不清/存疑 | 人工确认 |
标签体系定义在 videoAutoEdit.ts#L13。你可以直接对 AI 下达剪辑目标,例如:
“帮我把这条 3 分钟的口播剪成 1 分钟,去掉所有口头禅和重复表达。”
AI 会把你的目标(userGoal)和目标时长(targetDurationMs)一起写进剪辑计划,逐句给出“保留 / 删除”的判断和理由——“嗯、就是、然后呢”这类 filler 片段会被自动剔除,而不是靠你在时间轴上手动一刀一刀剪。
第三步:自动生成剪辑计划,可逐条撤销
语义分析结束后,AI 会产出一份完整的 AutoEditPlan(自动剪辑计划):
- selectedSegments:保留哪些片段、每段的角色(hook 钩子 / proof 证明 / cta 行动号召 / filler-removal 去废话)和优先级;
- removedSegments:删掉了什么、为什么删;
- titleCards:需要的话自动插入章节标题卡;
- warnings:风险提醒,比如某句删掉后上下文断裂。
计划确认后才会应用到时间线,且整个工程带撤销栈(undoStack)——剪错了可以回退,不需要重新来。
第四步:渲染出片,字幕自动烧录
确认剪辑计划后,Beav 会把时间线编译成 Remotion 渲染合成(videoAutoEditRemotion.ts):
- 每个保留片段生成一个场景,自动搭配轻微的推拉运镜,避免画面呆板;
- 字幕轨自动对齐,生成带半透明底色的烧录字幕;
- 渲染完成后进入媒体库(MediaLibrary),可直接发布或二次编辑。
画幅支持 16:9、9:16、4:5、1:1 等——做小红书竖版口播直接选 9:16 即可,做横版知识类选 16:9。
不用时间轴?聊天里也能一键剪辑
如果你只是想快速切几条能发出去的短视频,不用进入时间轴。上传视频到 AI 对话后,附件菜单自带三个一键工作流(Chat.tsx#L693-L737):
- 爆款分析:分析前 3 秒钩子、情绪曲线,输出改造方案;
- 字幕提取:一键导出 SRT / TXT 清洁字幕;
- 剪辑切片:自动找出 3-5 个最值得发布的切片,逐个给出开始/结束时间、爆点理由和推荐标题,再直接剪成独立成片,并且保证每片上下文完整,不会只剪一句没头没尾的话。
常见问题
- 为什么 AI 生成口播视频单段最长 15 秒?这是上游视频模型的硬限制,超过 15 秒的成片会被拆成多段生成后自动拼接成一个完整文件,对你来说仍然是“一条成片”(规则见 video-director/SKILL.md)。
- 转录不准怎么办?在设置中检查转写端点/模型配置;Beav 官方通道使用
fun-asr,对中文口播识别效果较好。 - 口播数字人视频怎么做?Beav 内置 video-director 技能:先出脚本和分镜、你确认后再生成,避免“AI 自由发挥”导致的返工。
总结
Beav 智能剪口播的完整链路是:逐词转录 → 语义分析去口头禅 → 自动生成剪辑计划 → 渲染出片,全程 AI 决策、人工只需确认,5 分钟拿到成片只是起点。它同时也是一个完整的小红书 AI 运营工作台:素材库、选题、AI 写作、评论区下载一应俱全,适合自媒体人“采集-创作-发布”一体化使用。
延伸阅读:口播视频生成完整规则见 video-director 技能文档,多 Agent 剪辑编排逻辑见 orchestration_runtime.rs。
- 人工智能
- AI 应用
- AI 写作
- 媒体生成
- 工作流自动化
- 网页爬虫
- 浏览器控制
【免费下载链接】Beav
小红书 AI 运营工作台|小红书采集、评论区下载、素材库、选题、AI写作、小红书全域解决方案,开箱即用,一键安装,小红书AI工作台,自媒体素材库,AI写作+图片自动编排,小红书版OpenClaw、自媒体资产底座+AI工作台,支持小红书图文+小红书评论区下载、小红书AI创作工具、自媒体版WorkBuddy、抖音、小红书爬虫数据采集
相关推荐
Foobar2000逐字歌词终极教程:5分钟让歌词动起来!
Foobar2000逐字歌词终极教程:5分钟让歌词动起来! 你是不是也厌倦了传统歌词那种死板的显示方式?想要让歌词像KTV那样逐字跳动,与音乐完美同步吗?今天我
音视频5分钟搞定接口调试:HttpBin自定义响应头完全指南
5分钟搞定接口调试:HttpBin自定义响应头完全指南 你是否遇到过这些接口调试难题?前端请求需要带特定Origin头才能跨域,移动端API要求自定义设备标识,
开发工具测试API设计OBS智能镜头:3分钟实现直播自动对焦
OBS智能镜头:3分钟实现直播自动对焦 您是否在直播或录制视频时经常需要手动调整镜头位置?OBS Face Tracker面部追踪插件为您带来革命性的智能镜头体
计算机视觉音视频
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考