Parakeet Redux
Moondream团队基于NVIDIA Parakeet 0.6B v3开发的三值量化语音识别模型,通过将权重压缩至-1/0/+1三个离散值,实现约七分之一的体积压缩,支持25种欧洲语言识别
Timeline (last 90 days)
Parakeet Redux 是 Moondream 团队基于 NVIDIA Parakeet 0.6B v3 制作的三值量化语音转文字模型,体积从约1.2GB压缩到约178MB
Moondream 将 Parakeet 编码器中的每个权重强制压缩成 -1、0、+1 三个值之一(三值量化),每个权重约需1.58位存储
三值量化仅应用于编码器而非解码器,这是准确率损失小的关键原因之一
Parakeet Redux 的英语词错率(WER)从6.26升到6.55,多语言得分从11.62改善到10.56,长音频从2.71改善到2.51
Parakeet Redux 支持25种欧洲语言并能自动检测语种
Parakeet Redux 可在CPU上运行,磁盘占用178MB,而对比的 Whisper Large V3 Turbo(Whisper CPP版本)占1.6GB
在 M2 MacBook Air 的CPU测试中,Redux 达到38倍实时速度,Parakeet CPP 只有12倍,约3倍领先;但在Mac GPU上两者接近(43 对 38/39倍)
文章标题宣称的113倍实时速度是在带AVX512的AMD EPYC服务器上测得,而非Mac
在噪声音频基准上,Parakeet Redux 错误率从6.72跳到约9,模型卡承认Redux更容易把音频替换成发音相近的词
Parakeet Redux 的模型权重采用 Creative Commons 协议开放,但驱动引擎 Photon 并不开源
4 more timeline events
All Facts (14)
Parakeet Redux 是 Moondream 团队基于 NVIDIA Parakeet 0.6B v3 制作的三值量化语音转文字模型,体积从约1.2GB压缩到约178MB
50%UnverifiedMoondream 将 Parakeet 编码器中的每个权重强制压缩成 -1、0、+1 三个值之一(三值量化),每个权重约需1.58位存储
50%Unverified三值量化仅应用于编码器而非解码器,这是准确率损失小的关键原因之一
50%UnverifiedParakeet Redux 的英语词错率(WER)从6.26升到6.55,多语言得分从11.62改善到10.56,长音频从2.71改善到2.51
50%UnverifiedParakeet Redux 支持25种欧洲语言并能自动检测语种
50%UnverifiedParakeet Redux 可在CPU上运行,磁盘占用178MB,而对比的 Whisper Large V3 Turbo(Whisper CPP版本)占1.6GB
50%Unverified在 M2 MacBook Air 的CPU测试中,Redux 达到38倍实时速度,Parakeet CPP 只有12倍,约3倍领先;但在Mac GPU上两者接近(43 对 38/39倍)
50%Unverified文章标题宣称的113倍实时速度是在带AVX512的AMD EPYC服务器上测得,而非Mac
50%Unverified在噪声音频基准上,Parakeet Redux 错误率从6.72跳到约9,模型卡承认Redux更容易把音频替换成发音相近的词
50%UnverifiedParakeet Redux 的模型权重采用 Creative Commons 协议开放,但驱动引擎 Photon 并不开源
50%Unverifiedpip install 时会拉入一个名为 Kestrel Kernels 的包,其许可证规定未签订某项协议则无使用授权
50%Unverified本地语音转录的核心价值在于隐私和离线工作,而非省钱
50%Unverified决策建议:纯CPU或老旧机器及对体积敏感的App值得用Redux;已用M系列Mac GPU的用户用开源运行时速度相近且许可证更清晰;处理噪声音频应使用原版
50%Unverified开放权重并不等于开放技术栈,Parakeet Redux 的高性能深度依赖闭源的 Photon 运行时,社区尚无成熟替代实现
50%