Nemotron-3-Diarization API详解4种输入方式与输出结果怎么用对【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-DiarizationNemotron-3-Diarization 是 NVIDIA 开源的说话人分离Speaker Diarization模型专门回答音频中谁在什么时候说话。它最多支持 8 位说话人同时覆盖流式与离线两种推理场景。本文带你一次看懂diarize()API 的 4 种输入方式与 2 种输出结果并按延迟需求选对流式参数组让 API 第一次就用对。1️⃣ 快速认识这个模型能做什么Nemotron 3 Diarization 是一个 1 亿参数的 Transformer 编码器31 层带 RoPE 位置编码把 10 ms 梅尔频谱特征降采样为 80 ms 帧率处理流式推理时通过AOSC按到达顺序的说话人缓存 FIFO 队列在分块之间保持说话人身份稳定。一句话概括输入一段音频输出每个时刻是谁在说话。关键能力说明说话人数上限最多 8 人通道按谁先出现自动排序输入音频16 kHz 单声道支持.wav/.flac/.opus/.mp3时长限制分块推理下无固定上限输出帧分辨率默认 10 ms可配置为 10 ms 的任意倍数最低输入缓冲延迟0.32 s离线配置为 30.4 s2️⃣ 四种输入方式diarize()的 audio 参数怎么传调用核心只有一行predicted_segments diar_model.diarize(audioaudio_input, batch_size1)区别全在audio_input的传法上官方支持 4 种方式一单个音频文件路径最简单适合快速验证audio_input /path/to/multispeaker_audio1.wav方式二文件路径列表批量推理一次处理多段音频batch_size与之配合audio_input [/path/to/multispeaker_audio1.wav, /path/to/multispeaker_audio2.wav]方式三Numpy 数组单个或列表内存中音频适合流式管线中已经解码好的 PCM 数据import numpy as np audio_input np.random.randn(16000 * 10).astype(np.float32) # 10秒16kHz diar_model.diarize(audioaudio_input, batch_size1, sample_rate16000)⚠️重点提示传 Numpy 数组时必须显式指定sample_rate默认 16000传数组列表时更不可省略。方式四JSONL manifest 文件大批量/评测场景每行一个 JSON 对象含audio_filepath、offset、duration字段{audio_filepath: /path/to/multispeaker_audio1.wav, offset: 0, duration: 600} {audio_filepath: /path/to/multispeaker_audio2.wav, offset: 900, duration: 580} 小贴士非标准音频建议先用 ffmpeg 转成 16 kHz 单声道 PCMffmpeg -i input.mp3 -ac 1 -ar 16000 -c:a pcm_s16le conversation.wav3️⃣ 两种输出结果拿到数据后怎么读默认输出带说话人标记的片段列表predicted_segments diar_model.diarize(audioaudio_input, batch_size1) # 每个片段形如(开始秒, 结束秒, speaker_index)这是最常用的形式——直接得到起止时间 说话人编号。可选输出说话人活动概率张量加一个参数即可同时拿到逐帧概率predicted_segments, predicted_probs diar_model.diarize( audioaudio_input, batch_size1, include_tensor_outputsTrue)读这个张量只需记住 4 点形状为[T, 8]T 个输出帧 × 8 个说话人通道取值是 0~1 的活动概率8 个通道按说话人在音频中首次出现的时间排序第 0 通道就是最先开口的人默认帧分辨率 10 ms可配置为 30 ms、80 ms、240 ms 等任意 10 ms 倍数概率经后处理即可得到类似[speaker1, 0.51, 12.62]的通用标签 时间戳。4️⃣ 流式参数速查一张表选对延迟配置流式配置以80 ms 帧为单位定义官方给出 4 档推荐参数详见 README.md配置延迟SPKCACHE_LENFIFO_LENCHUNK_LENRIGHT_CONTEXTUPDATE_PERIOD离线精度优先30.4 s2644034040300低延迟1.04 s26426494222超低延迟0.64 s26426462222极超低延迟0.32 s26426431222两个使用要点延迟 (CHUNK_LEN RIGHT_CONTEXT) × 80 ms不含计算耗时参数设置完成后记得调用diar_model._check_streaming_parameters()做校验延迟越低精度会略有下降按业务取舍。5️⃣ 进阶一步从谁说了到说了什么分离模型只回答who spoke when要生成谁说了什么的说话人归属转写需搭配流式 ASR 模型。官方给出两种受支持组合及完整命令参数完整流程见 ASR_INTEGRATION_GUIDE.md。如果你要做效果评测DER / SCA / MAE 指标的定义与推荐评测命令见 diarization_evaluation.md。6️⃣ 常见坑位清单说话人编号≠真名输出的speaker_index只是会话内身份编号不代表真实姓名展示人名需要应用层另行映射超过 8 人模型只有 8 个通道更多说话人会漏检或被错分忘了 sample_rate传 Numpy 数组而不指定采样率结果会整体跑偏音频格式不对务必 16 kHz 单声道否则可能被拒绝或效果变差重连后编号变了标签是会话局部的断开重连后身份编号会重新分配这属于正常行为。相关资料README.md完整使用说明与性能数据 · ASR_INTEGRATION_GUIDE.mdASR 集成指南 · diarization_evaluation.md评测协议 · Nemotron-3-Diarization.nemo模型检查点【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
从零手搓大模型(八)国产开源模型Qwen3 Qwen3 From Scratch 教程:贴近现代国产开源模型的结构
这个博客很适合想理解 Qwen 系列、国产开源模型、现代 LLM 工程结构的人。
一句话理解: Qwen3 在 Llama 风格 decoder-only 架构上,加入了 Qwen 自己的配置、QK norm、GQA、RoPE、MoE 变体和 KV cache 推理优化。 1. … · 2026/9/25 13:00:33
大模型+LoRA微调:货拉拉同城货运广告文案智能生成实战 货拉拉这种同城货运平台的营销广告,跟传统电商广告完全不是一回事。用户没有“逛”的心智,打开App就是要搬家、要拉货、要叫车,需求来得急、决策时间短、地域属性极强。过去半年,我们团队一直在做一件事:把大模型引入货… · 2026/9/25 13:00:27
AI代码审查误报率治理:按类别采纳率与门禁设置实战 1. 从“误报率”说起:AI 代码审查为什么总在喊狼来了做过 AI 代码审查落地的人,大概率都经历过这个阶段:工具刚接入 CI,团队兴致勃勃,第一周报告里刷出几百条“潜在缺陷”,第二周开发开始抱怨“全是噪音”&… · 2026/9/25 13:00:21
DeskcommCRM实战:如何构建销售团队愿意用的客户管理系统 DeskcommCRM:从零搭建一套销售团队真正愿意用的客户管理系统拿到 DeskcommCRM 这个项目代号的时候,我第一反应是:这又是一套"领导想管人、销售嫌麻烦"的客户关系管理系统。客户团队提需求时七嘴八舌,总结下来就一句话&a… · 2026/9/25 13:24:28
萤火商城v2.0.8多端版:一套代码编译五端的工程实践与避坑指南 简介:萤火商城 v2.0.8 多端版是一套轻量级、高性能、前后端分离的开源电商系统,面向希望快速搭建独立商城的开发者、创业者及二次开发学习者。系统支持微信小程序、H5、公众号与 APP 多端覆盖,前后端源码 100% 开源,所见即所得&am… · 2026/9/25 13:24:28
DeskcommCRM实战拆解:从沟通资产到销售团队落地的轻量CRM设计 第一次看到 DeskcommCRM 这个词的时候,我第一反应是:这不像一个传统 CRM 的产品名。“Desk”加“comm”加“CRM”,组合方式透着一种很明确的取向——它不打算做那种销售经理喜欢、一线销售却极其抗拒的“录入系统”。我后来跟几个做客户管理的… · 2026/9/25 13:24:28
抖音无水印批量下载:3步把博主主页上百条作品存进电脑 抖音无水印批量下载:3步把博主主页上百条作品存进电脑 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback suppo… · 2026/9/25 13:24:28
桌面端CRM如何整合客户沟通与预约管理?DeskcommCRM实战解析 不知道你有没有遇到过这种场景:客户微信上问你"这周六下午还能约吗",你翻聊天记录翻到半小时前,又去查一个Excel排班表,再跑到另一个系统里找客户上次消费的记录,来回切换几个窗口总算凑齐了信息,… · 2026/9/25 13:24:22
UE5 GAS技能系统核心模块与网络同步实战解析 1. 为什么要用GAS:技能系统从来不只是"放个技能"先说个真实场景。我遇到过很多团队,做技能系统的第一步是在角色身上加一个状态变量,比如bIsCastingFireball,再用Switch节点判断当前状态,技能冷却就开个Time… · 2026/9/25 13:24:22
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37