DIHARD III 上 DER 直降七成:Nemotron-3-Diarization 基准成绩单刚出炉就炸了
发布时间:2026/10/10 21:59:51 锦皓数字建站

DIHARD III 上 DER 直降七成Nemotron-3-Diarization 基准成绩单刚出炉就炸了【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization2026 年 9 月 23 日NVIDIA 在 Hugging Face 上发布了开放权重的 Nemotron-3-Diarization 说话人分离模型100M 参数、最多 8 说话人、流式与离线双模推理、输入缓冲时延最低可到 0.32 秒且直接商用。相比社区熟悉的 NeMo 4 说话人流式 Sortformer 基线这份刚公布的基准成绩单在 DIHARD III、NOTSOFAR1、CALLHOME、AMI、AliMeeting 等 8 个测试集上全面刷新 DER说话人分离错误率其中多说话人密集场景的降幅最扎眼——NOTSOFAR1 的 5~7 人子集 DER 直接砍掉七成以上。本文从仓库模型卡与评估文档出发逐条拆解这份成绩单的读法、七成降幅背后的测试集构成以及它对下游选型的第一波冲击。先给直降七成精确到位它不是 DIHARD III 全集的数字而是多说话人密度最高的 NOTSOFAR1 5~7 人子集拿下的MHM 通道 29.38 → 7.86降 73.2%单通道 38.42 → 13.21降 65.6%。DIHARD III 全量 DER 同样从 19.09 压到 12.735~9 人子集从 40.21 压到 27.58。八张表算下来平均降幅约 42%。这份成绩单的含金量取决于你是否读懂了它的评分协议。一、成绩单逐条拆解DER、SCA、MAE 与 RTFx 到底意味着什么说话人分离领域的核心指标不是准确率而是 DER。根据仓库的 评估说明DER 是三个错误分量之和按被评分的参考说话人时长归一化DER false alarm虚检 missed speech漏检 speaker confusion说话人混淆同一份文档特别提醒DER 只有在完整披露评分协议时才有可比性——包括 collar 容差、是否计入重叠语音、参考标注来源、流式参数、精度与硬件。这份成绩单的协议是DIHARD III、AliMeeting、AMI、NOTSOFAR1 均采用 0 秒 collarCALLHOME-Part2 采用 0.25 秒 collar全部计入重叠语音AMI、AliMeeting、NOTSOFAR1 使用强制对齐forced alignment的帧级参考 RTTM而不是原始分段标注。模型卡为此单列了一段 IMPORTANT 提示使用不同参考标注算出的 DER 属于不同评估协议不可直接比较。除 DER 外成绩单还给出两个说话人数统计指标SCA说话人计数准确率预测说话人数与参考完全相等记 1否则记 0MAE计数平均绝对误差|预测人数 − 参考人数|比 SCA 更能反映计数偏差的大小RTFx实时因子加速比音频总时长 / 总处理时长衡量推理吞吐。先看全貌——8 个测试集、离线配置30.4 秒缓冲下的全量 DER 对比测试集说话人范围基线 DERNemotron-3 DER降幅DIHARD III Eval1–919.0912.7333.3%CALLHOME-Part22–610.329.1011.8%AliMeeting Test Near2–411.576.4044.7%AliMeeting Test Far2–413.6910.4723.5%AMI Test MHM3–415.819.2541.5%AMI Test SDM3–421.4211.1448.0%NOTSOFAR1 Eval MHM3–721.776.7768.9%NOTSOFAR1 Eval SC3–730.4911.0063.9%8 个测试集平均降幅约 42%与社区实测文章的结论一致。但更有信息量的是 DIHARD III 这张细分表——它按录音人数把测试集拆成 1~4 人与 5~9 人两档延迟配置模型1–4 人 DER5–9 人 DER全量 DERSCAMAE30.4 s4 说话人基线13.9840.2119.0975.290.513530.4 sNemotron-39.1327.5812.7381.470.26640.32 s4 说话人基线14.3742.7119.8566.800.58690.32 sNemotron-39.6929.4913.5576.450.3282两处细节值得放大。其一MAE 从 0.5135 压到 0.2664接近腰斩——模型不仅说话人标得准而且人数数得对这对下游的路由、计费、席位分配类业务是直接利好。其二把延迟从 30.4 秒收到 0.32 秒Nemotron 的 DIHARD III 全量 DER 只从 12.73 微涨到 13.550.82 个百分点而基线在同样压缩下从 19.09 涨到 19.85 的同时 SCA 掉了近 9 个点。也就是说实时化的代价被明显摊薄了。推理侧成绩单用 RTFx 衡量吞吐Blackwell RTX PRO 5000、BF16、含 eager 与 torch.compile 两列延迟配置基线 RTFxbatch1eager/compiledNemotron-3 RTFxbatch1eager/compiled基线 RTFxbatch32Nemotron-3 RTFxbatch3230.4 s874 / 14681340 / 43853204 / 261912196 / 151131.04 s16 / 4238 / 164193 / 136581 / 8650.32 s8 / 2112.5 / 54101 / 76199 / 292换算成可感知的数字离线配置下一张 RTX PRO 5000 以 batch32 跑编译模式RTFx 高达 15113——1 小时的会议录音约 0.24 秒处理完即便切到 0.32 秒超低延迟batch1 编译模式仍有 54 倍加速实时会议场景绰绰有余。相比基线吞吐在离线 batch32 下提升约 3.8~5.8 倍与社区实测的3.7~4.7 倍提速基本吻合。二、多说话人场景 70% 降幅背后的测试集构成为什么降幅在 NOTSOFAR1 上高达七成、在 CALLHOME 上只有 12%答案藏在测试集的人数结构里。模型卡的评估集明细给出了三组关键构成DIHARD III Eval259 段录音、1–9 人、11 个领域其中 1–4 人 219 段、5–9 人仅 40 段占 15.4%NOTSOFAR1 EvalMHM 与 SC 两个条件各 160 段会议录音、3–7 人其中 3–4 人 70 段、5–7 人 90 段占 56.3%CALLHOME-Part2250 段电话语音、2–6 人5 人 5 段、6 人 3 段5 人以上合计仅 8 段占 3.2%。把超过 4 人的录音占比和全量 DER 降幅放在一起规律非常清晰测试集4 人录音占比全量 DER 降幅CALLHOME-Part23.2%11.8%DIHARD III Eval15.4%33.3%NOTSOFAR1 Eval MHM56.3%68.9%NOTSOFAR1 Eval SC56.3%63.9%原因并不玄妙基线是 4 说话人模型。一旦录音人数超过 4基线在架构上就没有多余声道去容纳第 5 个说话人DER 必然被说话人混淆推高。NOTSOFAR1 的 5~7 人子集正是基线的真空区MHM 条件基线 DER 高达 29.38Nemotron 直接打到 7.86SC 条件从 38.42 压到 13.21。更夸张的是计数能力——NOTSOFAR1 MHM 上 SCA 从 35.00 飙升到 93.75MAE 从 0.9375 跌到 0.0625意味着基线在过半录音里连有几个人都数不对而新模型几乎次次数对。但测试集构成只能解释一部分降幅。注意 AMI3–4 人全部在基线容量内依然拿下了 41.5%~48.0% 的 DER 削减AliMeeting Near 也有 44.7%。这说明提升不只来自8 声道替换 4 声道的容量红利也来自模型质量本身根据模型卡训练采用两阶段策略——先在 8 节点 × 8 张 A100-SXM4-80GB 上、用 8.26 万小时 FastMSS 合成混音离线预训练再用约 1 万小时真实多说话人对话做流式微调初始化为 NEST 自监督检查点。真实对话覆盖 Fisher、AMI、ICSI、VoxConverse、AISHELL-4、DIHARD III dev、AliMeeting、DiPCo、NOTSOFAR1、DISPLACE 等多语种语料另叠加 MUSAN 噪声增强。数据规模与领域宽度是 DIHARD III 这种 11 领域全能型基准上稳定领先的真正底气。还有一个容易被忽视的细节AMI、AliMeeting、NOTSOFAR1 的成绩是用强制对齐参考标注算出来的。这些语料的原始分段标注以转写为目的常把段内静音标成语音直接用来算 DER 会系统性抬高漏检误差。换参考标注等于换协议所以模型卡强调必须使用公布的参考 RTTM 复现评估时还要求在同一 manifest 中附带rttm_filepath必要时加uem_filepath——详见 评估文档。读懂这层才不会把40% 降幅误读成刷分。三、这份成绩单对下游选型的第一波冲击冲击一8 人容量把会议转写类场景拉回单模型方案此前 NeMo 生态的流式 Sortformer 基线只支持 4 说话人稍正式的多人会议、圆桌播客就触及天花板工程上不得不用 VAD 聚类后处理的传统链路兜底。Nemotron-3-Diarization 把声道数提到 8并用两个机制保证流式下的身份稳定AOSC按到达顺序的说话人缓存跨 chunk 保留说话人信息FIFO 队列为每一步提供近期帧上下文输出通道按说话人在音频中的首次出现顺序排列从根上规避了说话人置换问题。模型卡定义的流式参数都按 80ms 帧计量四种官方推荐配置把时延—精度—吞吐三角摆得明明白白配置输入缓冲时延SPKCACHE_LENFIFO_LENCHUNK_LENRIGHT_CONTEXTUPDATE_PERIOD离线Very high30.4 s2644034040300低时延Low1.04 s26426494222很低时延Very low0.64 s26426462222超低时延Ultra-low0.32 s26426431222时延公式是(CHUNK_LEN RIGHT_CONTEXT) × 80ms不含计算耗时。落到代码上切换配置只需改四个属性再校验一次from nemo.collections.asr.models import SortformerEncLabelModel diar_model SortformerEncLabelModel.restore_from( restore_path/path/to/Nemotron-3-Diarization.nemo, map_locationcuda, strictFalse, ) diar_model.eval() # 0.32 s 超低时延(3 1) × 80 ms diar_model.sortformer_modules.spkcache_len 264 diar_model.sortformer_modules.fifo_len 264 diar_model.sortformer_modules.chunk_len 3 diar_model.sortformer_modules.chunk_right_context 1 diar_model.sortformer_modules.spkcache_update_period 222 diar_model._check_streaming_parameters() segments, probs diar_model.diarize( audio[/path/to/conversation.wav], batch_size1, include_tensor_outputsTrue, ) print(segments[0][:3]) # [[speaker1, 0.51, 12.62], ...] print(probs.shape) # [T, 8]每帧每声道的说话人活动概率输入既可以是单文件路径、路径列表、numpy 数组也可以是逐行 JSON 的 manifest含audio_filepath/offset/duration输出则是带起止时间的匿名说话人片段或[T, 8]的概率张量。默认 10ms 帧分辨率可按 10ms 整数倍调整。冲击二流式 ASR 配对谁说了什么端到端化成绩单只回答谁在何时说话下游真正要的是谁说了什么。仓库的 ASR 集成指南 给出了两条官方配对路线Multitalker Parakeet面向重叠语音的多说话人流式 ASRmasked_asrfalse与 Nemotron 3.5 ASR支持 32 个语言地区的单说话人流式模型masked_asrtrue两者由speech_to_text_multitalker_streaming_infer.py耦合驱动——分离模型产出帧级说话人活动ASR 为每个检出的说话人维护独立转录流cache_gating只在分离模型判定某人近期活跃时才跑他的 ASR 分支明显省算力。产出是 NeMo 的 SegLST 格式 JSON每一条含文本、时间区间与匿名说话人标签。值得注意的是指南明确警告标签是会话局部的不是生物特征身份——应用若要显示姓名必须另做注册映射且会话隔离、逐 chunk 缓冲等状态绝不能跨客户端共享。对做实时字幕、会议纪要、呼叫质检的团队来说这意味着分离 多说话人转写从多组件拼装变成一条受支持的官方管线选型风险显著下降。冲击三商用许可 消费级 GPU私有化部署门槛被压低模型遵循 OpenMDW 1.1 许可模型卡明确ready for commercial or non-commercial use。硬件兼容性覆盖 AmpereRTX 30 系、A100、AdaRTX 40 系、L4/L40、BlackwellRTX 50 系、B200/GB200与 HopperH100/H200全代际一张 RTX 4090 或 5090 就能本地跑推理结合前述 RTFx 数据离线批量场景单卡吞吐足够支撑大规模语料回灌流式场景则支持 8 路并发会话。对语音数据敏感、要求不出内网的政企场景模型权重开放意味着可以把整条分离 转写链路留在本地——这一点与仓库 隐私说明 强调的训练数据授权与用户侧合规责任形成呼应模型本身不输出身份信息但部署方仍需自行承担音频采集与处理的合规义务。冲击四评估纪律成为选型的隐形门槛最后这份成绩单给下游选型立了一条规矩比 DER必须先对齐协议。模型卡与 评估文档 都要求复现时采用官方评估脚本e2e_diarize_speech.py并在 manifest 中携带参考 RTTMpython ${NEMOTO_ROOT}/examples/speaker_tasks/diarization/neural_diarizer/e2e_diarize_speech.py \ model_path/path/to/Nemotron-3-Diarization.nemo \ dataset_manifest/path/to/diarization_manifest.json \ batch_size32 collar0 ignore_overlapfalse precisionbf16 \ spkcache_len264 chunk_len340 chunk_right_context40 \ fifo_len40 spkcache_update_period300报告 DER 时必须同时注明参考标注来源、collar、是否计入重叠、流式参数、精度与硬件否则数字不可比。这既是严谨性要求也是给采购方和评测团队的一把尺子谁的降幅 40%不含协议细节谁就值得打问号。把这份成绩单合起来看Nemotron-3-Diarization 的意义不止于又刷新了几个基准。它在 8 人容量、0.32 秒实时化、吞吐与商用许可四条线上同时往前推了一步并把 DER/SCA/MAE/RTFx 的评分协议连同复现脚本一起摊开——多说话人场景七成降幅背后的每一分都有测试集构成、训练数据和评估纪律撑住。对于正在选型会议转写、通话分析或多说话人 ASR 管线的团队这份刚出炉的成绩单值得读两遍一遍看数字一遍看协议。【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。