Unverified50% confidenceFactExact time
支持语音输入输出的全模态大模型在智能体基准测试数据集上的得分远远低于主流推理模型
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/18/2026
First Seen
Valid until: 11/16/2026
Sources
Related Claims
Unverified自回归模型(如VALL-E)逐token预测语音离散表征,能建模长程依赖和丰富韵律,但存在累积误差;非自回归模型(如FastSpeech)并行生成速度快但表现力受限75% similarUnverified当前最先进的说话人分离方案以TF-GridNet、Conformer-based模型为代表,在标准测试集上将词错率降低了60%以上75% similarUnverified在语码转换音频上微调模型效果最自然,但数据采集标注成本高,且对端侧小模型微调需注意灾难性遗忘问题75% similarUnverified语音识别对标准口音表现较好,但面对浓重地方口音、语速极快或背景噪音大的场景,识别准确率会明显下降73% similarUnverified高级话轮检测技术结合语音能量衰减模式、语调下降趋势、语义完整性判断以及对话上下文预测等多种信号72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/771146API
curl https://kongchang.com/api/v1/knowledge/claims/771146MCP
get_claim(id=771146)