[控场AI]
模型

mimo-v2-tts

mimo-v2-tts 是小米(Xiaomi)开发的文本转语音(TTS)合成模型,属于 mimo 系列语音技术的第二代版本。该模型能够将文本内容转化为自然流畅的语音输出,支持音频流式传输,适用于语音助手、智能设备及相关语音交互场景。

时间轴 (近 90 天)

5月31日

mimo-v2-tts的官方文档正文中描述音频标签控制使用中括号标记,但示例代码中全部使用圆括号,存在自相矛盾

待验证55%
5月31日

小米近期发布了名为mimo-v2-tts的开源语音合成模型

待验证85%
5月31日

mimo-v2-tts官方提供的5个示例文本均能正常工作,但开发者自行编写的文本会触发标签被朗读的BUG

待验证85%
5月31日

开发者通过逐字节对比官方示例和自定义文本中括号的ASCII编码,确认两者完全一致(均为EFBC88),排除了全角半角或字符编码差异的可能性

待验证85%
5月31日

mimo-v2-tts后端服务存在疑似请求串流问题,多次调用相同代码有时会返回与输入内容完全不相关的音频

待验证80%
5月31日

开发者实测发现mimo-v2-tts生成的音频内容有时听起来像是其他用户请求的生成结果,暗示后端存在请求串流

待验证75%
5月31日

mimo-v2-tts的请求串流问题可能导致用户文本内容通过音频泄露给其他人,存在数据隐私风险

待验证75%
5月31日

mimo-v2-tts上线后在开发者社区引发了大量负面反馈

待验证80%
5月31日

mimo-v2-tts的发布方式更接近研究预览阶段,但缺乏相应的免责说明和局限性标注

待验证70%

来源文章