FunClip 基于ASR的视频剪辑实战2小时多说话人录像按人拆出3段精华【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClipFunClip 是一款开源、本地部署的视频剪辑工具基于 FunASR 的 Paraformer 中文语音识别模型上传视频即可得到带时间戳的识别结果再按文本或说话人提取目标片段。图FunClip 主操作界面。左侧为 ASR 识别区与热词配置右侧为 LLM 智能裁剪与按文本/说话人裁剪两个页签。能力概览视频剪辑的4项核心能力带时间戳识别— Paraformer-Large 输出句级起止时间ModelScope 下载量超 1300 万。说话人分离— CAM 模型为每句标注 spk0/spk1 等 ID可按人提取。热词定制— 注册专有名词、人名提升该词汇的识别准确率。多段自由裁剪— 一次输出多个片段自动生成全片与片段的 SRT 字幕。运行原理从视频到精华片段的数据流输入视频文件 → FunASR阿里开源的端到端语音识别工具包先用 VAD语音端点检测切出语音段再用 Paraformer中文语音识别模型生成带时间戳的句子级文本勾选区分说话人时CAM说话人识别模型为每句分配 ID。裁剪时系统按输入文本或说话人 ID 反查时间戳用 moviepy 切出对应区间输出新视频与片段 SRT。最小启动3条命令跑起FunClip剪辑服务git clone https://gitcode.com/GitHub_Trending/fu/FunClip cd FunClip pip install -r requirements.txt执行后得到 FunClip 目录torch、gradio 等依赖包依次安装完成无报错即成功。提示ASR 模型权重在首次启动时单独下载建议在网络稳定的环境下执行。python funclip/launch.py执行后终端显示 Gradio 服务已启动浏览器打开localhost:7860即可看到中英文界面左侧是视频输入区右侧是裁剪区。提示英文音频加-l en启动Fun-ASR-Nano 与 SenseVoice 模型分别加-m fun-asr-nano、-m sensevoice。实战场景3个高频用例走查2小时会议录音按3个决策主题拆出片段适用于会议录像较长、只需保留特定议题片段的场景。上传会议录音点击识别获取全文与 SRT。从识别结果复制三处决策段落粘贴到待裁剪文本多段用#分隔。点击裁剪等待输出。产出物拼接好的新视频文件外加裁剪片段的 SRT 字幕。60分钟多说话人访谈提取嘉宾单人部分适用于访谈、圆桌等多人交替发言的视频。上传访谈视频点击识别区分说话人。识别结果中每句带 spk0、spk1 等前缀。在待裁剪说话人输入嘉宾的 ID如spk1。点击裁剪。图多说话人裁剪流程。识别结果 SRT 每句带说话人 ID右侧为按人裁剪后的视频与片段 SRT。产出物仅包含该嘉宾发言的视频以及对应该片段的字幕。90分钟网课自动裁出3个知识点带字幕片段适用于课程录屏需按知识点切片并直接分发。上传网课视频在热词填入课程专有名词后识别。在文本框输入要提取的知识点语句用#分隔多段。调整字幕字号与颜色点击裁剪字幕。图六步操作流程覆盖上传视频、配置热词、ASR 识别、复制段落、设置偏移量到裁剪输出。产出物烧录字幕的课程片段视频与 SRT 文件可直接用于二次分发。进阶功能解锁LLM智能裁剪与多说话人拼接LLM 智能裁剪— 适合挑出精彩片段这类无固定文本的意图入口右侧 LLM 页签改 Prompt、点LLM推理再点AI Clip接口层见 funclip/llm/。注意LLM 输出须为N. [开始-结束] 文本格式时间戳才反查得到。多说话人合并裁剪— 说话人框输入spk0#spk2两人片段依次拼接。注意须先执行识别区分说话人。命令行裁剪— 自动化场景可用videoclipper.py --stage 1/2两段式调用见 funclip/videoclipper.py。注意stage 2 需指定 stage 1 的 output_dir。图LLM 裁剪三步法先选模型并配置 API Key再执行 LLM 推理最后点击智能裁剪。常见问题高频问题速查识别结果不准怎么办— 在热词框填入专有名词与人名空格分隔仅支持中文热词随后重新执行识别。英文视频怎么裁剪— 用python funclip/launch.py -l en启动英文模型后续步骤与中文一致。裁剪片段想前后多留一点— 调整开始位置偏移与结束位置偏移滑块范围 -500 至 1000 毫秒逐段生效。如何裁出烧录字幕的视频— 使用裁剪字幕按钮并预设字号、颜色该功能需提前安装 imagemagick 并放置字体到font/目录。多语种高精度识别怎么选模型— 加-m fun-asr-nano或-m sensevoice启动两者不提供可靠字符级时间戳按文本精确裁剪仍用默认 Paraformer。适用边界适合与不适合的场景适合不适合中文会议、访谈、课程录像的片段提取强噪声、多人同讲、重方言口音的识别按文本/说话人/LLM 意图裁剪并输出 SRT调色、转场、配乐替换等专业后期剪辑本地离线部署、单视频多段连续裁剪数百视频的批量任务无独立任务队列延伸与参与社区与文档入口问题反馈与功能建议提交至仓库 Issues贡献规范见 CONTRIBUTING.md。版本说明见 docs/releases/v2.1.0.md核心裁剪逻辑在 funclip/videoclipper.py。团队正在推进反向时间段选择与静音段落移除两个方向。【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Java养老管理系统实战:SSM架构、费用计算与避坑指南 简介:这份源码面向 Java 开发者、养老行业信息化人员及系统设计学习者,以可运行的完整工程呈现中州养老系统的设计与实践。压缩包共 141 个文件,包括 120 个 Java 源文件、17 个 XML 配置文件,以及 YML、JSON、Git 忽略文件和说明… · 2026/9/24 18:30:36
RHEL 9.2虚拟机安装与初始化配置实战:从VMware到yum源 1. 写在开头:为什么又开始折腾RHEL了如果你是个常年跟Linux打交道的人,一定对Red Hat Enterprise Linux这个名字不陌生。我最近又重新把RHEL装了一遍,起因其实挺简单——手头有个测试环境需要模拟生产服务器的运行场景,而生产那边… · 2026/9/24 18:30:36
VMware Workstation 导入 OVF/OVA 虚拟机模板完全指南 开头如果你跟我一样,是个在 Windows 电脑上用 VMware Workstation 跑虚拟机的人,那你大概率遇到过这种情况:从网上下载了一个现成的虚拟机镜像,结果解压出来不是一整个文件夹,而是一堆扩展名很陌生的文件——.ovf、.vm… · 2026/9/24 18:30:30
STAP仿真实战:ACP与AEP算法对比及MATLAB实现 简介:空时自适应信号处理(STAP)是雷达目标检测与抗干扰中的关键技术,尤其适用于合成孔径雷达(SAR)系统对弱目标、强杂波场景的探测。面向雷达信号处理学习者和工程开发人员,这里提供 ACP&#x… · 2026/9/24 19:06:56
随机森林实战指南:用sklearn实现花分类并调优模型 简介:这是一份面向机器学习初学者的随机森林花分类实践代码包,聚焦鸢尾花品种预测这一经典案例,帮助读者理解集成学习原理、Bootstrap抽样机制及sklearn建模流程。压缩包体积仅1KB,内含1个Python源文件,可直接运行&… · 2026/9/24 19:06:49
epoll 为什么快?红黑树 + 就绪链表的设计哲学与实战避坑 做网络编程的人,大概率都背过这道面试题: “epoll 为什么快?因为用了红黑树 就绪链表。” 但说实话,我见过很多人能背出这两个数据结构的名词,却说不清楚它们各自到底承担什么职责、为什么偏偏选这两种结构… · 2026/9/24 19:06:37
2026(9.21-9.23)周报 推进《七秒记忆》娃娃用品电商平台项目,完成原型页面搭建与需求文档迭代优化,梳理项目整体业务框架,为后续开发工作打下基础。在原型设计方面,我使用墨刀完成项目网站基础页面原型搭建,重点设计平台首页。完成顶部导航… · 2026/9/24 19:06:37
电磁波原理到通信应用:从频谱规划到天线选型全解析 开篇:为什么你天天用着通信,却不认识电磁波手机打电话、连Wi-Fi刷视频、开车用导航、坐地铁刷卡……这些场景背后,真正干活的都是同一个东西——电磁波。电磁波这个概念从中学物理就开始出现,但说实话,我接触过不少通信… · 2026/9/24 19:06:37
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44