待验证50% 置信事实精确时间
Whisper 音频先被转换为 80 维梅尔频谱图,经卷积层下采样后送入编码器生成特征序列,再由解码器以自回归方式逐 token 输出文本
1
来源数
50%
置信度
长期有效
时效性
2026/9/15
首次发现
来源
涉及实体
相关事实
待验证音频原生架构直接在梅尔频谱图或量化音频编码(如 EnCodec 产生的离散音频 Token)上进行自注意力计算,从而捕捉文本表示中缺失的韵律、情绪和说话人身份信息78% 相似待验证Whisper是编码器-解码器(encoder-decoder)结构76% 相似已验证Whisper基于Transformer编码器-解码器架构,在68万小时的多语言标注音频数据上进行弱监督训练75% 相似待验证频谱掩膜方法通常只处理幅度信息,使用原始混音的相位信息重建各声部波形,这种相位近似在声部高度混叠时会引入额外失真74% 相似待验证MusicGen和Stable Audio采用音频编解码器将音频压缩为离散token序列,再用类似语言模型的方式进行自回归生成74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/921766API
curl https://kongchang.com/api/v1/knowledge/claims/921766MCP
get_claim(id=921766)