Unverified60% confidenceFactExact time
端到端语音架构的先驱包括 Google 的 AudioLM(2022)和 Meta 的 Voicebox(2023)
2
Sources
60%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
OpenAI GPT-Live语音模型:全双工交互如何重塑人机对话
bilibili皮皮蟹勇闯天涯7/10/2026
Related Claims
UnverifiedMeta的Voicebox和Google的AudioPaLM是尝试将感知-理解-生成链路压缩进单一Transformer架构的语音系统82% similarUnverified端到端语音架构的代表性工作包括Google的AudioLM、Meta的Voicebox以及OpenAI Realtime API79% similarUnverifiedGoogle 的 AudioPaLM 是直接实现音频到音频映射的端到端语音模型78% similarUnverified语音编码器 + LLM 解码器的组合是 2023 年以来语音大模型的主流范式,Qwen-Audio、Gemini Audio、Phi-4-audio 等均采用类似设计73% similarUnverifiedGoogle的AudioLM(2022)和Meta的SeamlessM4T(2023)验证了直接在音频域进行建模的可行性73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/500220API
curl https://kongchang.com/api/v1/knowledge/claims/500220MCP
get_claim(id=500220)