Unverified60% confidenceFactExact time
若输入是音频,则可将Vision Encoder替换为Speech Encoder(语音编码器)进行编码对齐后输给大语言模型
2
Sources
60%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Verified神经音频编解码器如EnCodec、DAC将连续音频压缩为离散Token序列,使语音可像文字Token一样被自回归语言模型直接处理80% similarUnverifiedQwen的视觉大模型主要基于语言大模型前接Vision Encoder,处理语音的模型则前接语音Encoder,视觉与语言模型仍相对分离77% similarVerifiedWhisper的架构采用编码器-解码器结构,编码器将音频的梅尔频谱图转化为高维特征表示,解码器以自回归方式逐词生成文字输出74% similarUnverified文本编码器负责将自然语言提示词转换为高维嵌入向量供扩散模型的去噪过程使用74% similarUnverified多级编解码级联(tandem coding)会引入累积失真,经过三次以上编解码级联的音频其频谱失真模式已超出简单编解码器模拟所能覆盖的范围68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/907361API
curl https://kongchang.com/api/v1/knowledge/claims/907361MCP
get_claim(id=907361)