[控场AI]
模型Nemotron 3 Speaker Diarization

Nemotron 3

NVIDIA发布的开放权重说话人分离模型,参数量约1亿,支持最多8位说话人识别,支持流式与离线两种模式,采用允许商业使用的许可证

时间轴 (近 90 天)

10月3日

NVIDIA的Nemotron 3说话人分离模型仅99M参数,支持流式与离线推理,最多处理8个说话人,流式延迟最低80毫秒

待验证50%
9月29日

Nemotron 3 说话人分离模型参数量约1亿,仅需4GB显存即可运行

待验证50%
9月29日

Nemotron 3 可以处理多达8位说话人,而过去大多数模型的上限通常只有3到4位

待验证50%
9月29日

Nemotron 3 说话人分离模型被设计为与任何语音识别模型解耦配合,可搭配如Parakeet等ASR模型使用

待验证50%
9月29日

Nemotron 3 可视作对SortFormer的直接替代,且效果显著更好

待验证50%
9月29日

NVIDIA Nemotron 3 说话人分离模型是开放权重模型,且采用允许商业使用的许可证

待验证50%
9月29日

在作者的本地部署实测中,一段一分半的音频转录加分离只需三四秒

待验证50%
9月29日

模型对一整集时长超过一小时的All-In播客约在148秒内完成全部处理,并输出每位说话人的逐字转录及统计数据

待验证50%
9月29日

Nemotron 3 说话人分离模型本身只输出speaker_1、speaker_2等编号,不会自动识别人名

待验证50%
9月29日

Nemotron 3 支持流式与离线两种模式,且是语言无关的

待验证50%

全部知识事实 (10)

来源文章