Nemotron 3
NVIDIA发布的开放权重说话人分离模型,参数量约1亿,支持最多8位说话人识别,支持流式与离线两种模式,采用允许商业使用的许可证
时间轴 (近 90 天)
NVIDIA的Nemotron 3说话人分离模型仅99M参数,支持流式与离线推理,最多处理8个说话人,流式延迟最低80毫秒
Nemotron 3 说话人分离模型参数量约1亿,仅需4GB显存即可运行
Nemotron 3 可以处理多达8位说话人,而过去大多数模型的上限通常只有3到4位
Nemotron 3 说话人分离模型被设计为与任何语音识别模型解耦配合,可搭配如Parakeet等ASR模型使用
Nemotron 3 可视作对SortFormer的直接替代,且效果显著更好
NVIDIA Nemotron 3 说话人分离模型是开放权重模型,且采用允许商业使用的许可证
在作者的本地部署实测中,一段一分半的音频转录加分离只需三四秒
模型对一整集时长超过一小时的All-In播客约在148秒内完成全部处理,并输出每位说话人的逐字转录及统计数据
Nemotron 3 说话人分离模型本身只输出speaker_1、speaker_2等编号,不会自动识别人名
Nemotron 3 支持流式与离线两种模式,且是语言无关的
全部知识事实 (10)
NVIDIA的Nemotron 3说话人分离模型仅99M参数,支持流式与离线推理,最多处理8个说话人,流式延迟最低80毫秒
50%待验证Nemotron 3 说话人分离模型参数量约1亿,仅需4GB显存即可运行
50%待验证Nemotron 3 可以处理多达8位说话人,而过去大多数模型的上限通常只有3到4位
50%待验证Nemotron 3 说话人分离模型被设计为与任何语音识别模型解耦配合,可搭配如Parakeet等ASR模型使用
50%待验证Nemotron 3 可视作对SortFormer的直接替代,且效果显著更好
50%待验证NVIDIA Nemotron 3 说话人分离模型是开放权重模型,且采用允许商业使用的许可证
50%待验证在作者的本地部署实测中,一段一分半的音频转录加分离只需三四秒
50%待验证模型对一整集时长超过一小时的All-In播客约在148秒内完成全部处理,并输出每位说话人的逐字转录及统计数据
50%待验证Nemotron 3 说话人分离模型本身只输出speaker_1、speaker_2等编号,不会自动识别人名
50%待验证Nemotron 3 支持流式与离线两种模式,且是语言无关的
50%