Verified80% confidenceFactTime unknown
Whisper的架构采用编码器-解码器结构,编码器将音频的梅尔频谱图转化为高维特征表示,解码器以自回归方式逐词生成文字输出
6
Sources
80%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified文本编码器负责将自然语言提示词转换为高维嵌入向量供扩散模型的去噪过程使用82% similarUnverifiedWhisper 将语音识别、语言识别、时间戳预测和语音翻译统一为序列到序列任务,通过特殊控制标记指定任务类型75% similarUnverified若输入是音频,则可将Vision Encoder替换为Speech Encoder(语音编码器)进行编码对齐后输给大语言模型74% similarVerified神经音频编解码器如EnCodec、DAC将连续音频压缩为离散Token序列,使语音可像文字Token一样被自回归语言模型直接处理74% similarUnverifiedFD-VAD 的架构由冻结的语音编码器、轻量级模态适配器和参数高效适配的语言模型组成73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/8513API
curl https://kongchang.com/api/v1/knowledge/claims/8513MCP
get_claim(id=8513)