从2小时会议录像到关键片段:FunClip零代码AI视频剪辑实战笔记
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
FunClip是一款本地部署的AI视频剪辑工具。它先用FunASR系列模型把长视频的语音转成带时间戳的文本,再让你按文本、按说话人或借助大语言模型选中片段,裁出对应视频。全程在浏览器里完成,不需要剪辑软件,也不需要写代码。
核心能力:语音识别、字幕生成与说话人分离
FunClip的路线是一条识别链路加多种裁剪出口。默认模型Paraformer-Large是阿里巴巴开源的中文语音识别模型,识别的同时输出每句的起止时间戳,任意一段文字都能对应到视频时间轴上。识别结果还可以用CAM++模型给每句标注说话人ID,访谈和圆桌讨论里能把某个人的发言按ID整段裁出来。SeACo-Paraformer提供热词功能,把人名、专业名词预先列出来,这些词在识别时更容易被准确命中。
语言方面也不局限于中文:-l en启动英文识别模型,-m还能选择fun-asr-nano(覆盖普通话、英语、日语和中文方言)或sensevoice(额外输出情绪与音频事件标签)。v2.0起加入大语言模型智能剪辑,由模型先读完整份SRT字幕再自行挑段,项目为此提供了prompt配置入口。
安装依赖并启动服务
环境依赖只有一个Python环境。先克隆仓库并安装依赖:
git clone https://gitcode.com/GitHub_Trending/fu/FunClip cd FunClip pip install -r ./requirements.txt模型权重在启动时单独下载,不包含在源码归档里,首次运行请保持联网。若使用fun-asr-nano、sensevoice或字幕兼容路径,funasr需升到1.3.29及以上。启动服务后,浏览器访问的默认端口是7860:
python funclip/launch.py英文视频加-l en,-p改端口,-s生成公网访问链接。如需把字幕烧进画面,再额外安装imagemagick,否则识别与裁剪不受影响。
实战走查:给会议录像裁出关键片段
这里以"从2小时会议录像中提取关键决策"为例。先在"视频输入"区上传录像,顺手填好两个可选项:热词(会议术语、人名)和文件输出目录。然后点"识别"拿到转写文本;如果视频里有多人发言,改点"识别+区分说话人",每句会多出一个说话人ID。
最后选定裁剪目标并点击导出按钮。入口有两个:把识别结果中需要的文字片段复制进文本裁剪框,或在说话人裁剪框里输入spk0这样的ID。每个文本片段后面可跟[起始偏移, 结束偏移]微调边界。点"裁剪"得到视频片段,点"裁剪+字幕"得到烧录字幕的视频,全视频SRT与目标段落SRT会一并产出。
同样一条流程也适用于别的素材:网课录像按知识点文字切片;自媒体口播素材挑出金句,识别后就能导出短视频。
容易踩的坑:专有名词、说话人边界与模型选择
专有名词和人名是识别错误的高发区。开工前把它们填进热词框,命中会明显好转;想不全就先按说话人ID裁剪,再手动核对段落边界。
说话人分离能覆盖大部分访谈场景,但对话来回很快时ID边界仍可能漂移。依赖说话人裁剪的视频,导出前把识别结果过一遍,别跳过这一步。
需要精确按文本裁剪时建议用默认的Paraformer。官方说明当前发布的Fun-ASR-Nano检查点不提供可靠的字符级时间戳,会影响文本位置匹配。
进阶用法:LLM智能剪辑与命令行批处理
LLM智能剪辑分两个按钮:识别完成后在下拉框选模型(deepseek-chat、qwen-plus、gpt-4-turbo、litellm接入的多家模型等),填好API密钥,点"LLM推理"让模型通读字幕并给出候选段落;再点"LLM智能裁剪",从输出中提取时间戳完成裁剪。各模型的接入代码在funclip/llm/。
多目标裁剪一次完成:多个说话人ID用#分隔(如spk0#spk2),多个文本片段同理;每个文本片段支持[起始, 结束]偏移。
命令行模式适合批处理:funclip/videoclipper.py把流程拆成两阶段,先--stage 1产出识别结果与SRT,再--stage 2按文本或说话人裁剪:
python funclip/videoclipper.py --stage 1 --file a.mp4 --output_dir ./output python funclip/videoclipper.py --stage 2 --file a.mp4 --output_dir ./output \ --dest_text "要提取的文本" --output_file ./res.mp4FunClip适合需要在不写代码的前提下切分长视频的人:会议组织者、课程制作方、自媒体编辑,识别、说话人分离、LLM剪辑全部在本地完成。源码采用MIT许可证,参数细节可查README_zh.md;遇到问题向仓库提交Issue,有prompt心得也可以分享给社区。
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考