待验证60% 置信事实精确时间
端到端语音架构的先驱包括 Google 的 AudioLM(2022)和 Meta 的 Voicebox(2023)
2
来源数
60%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
OpenAI GPT-Live语音模型:全双工交互如何重塑人机对话
bilibili皮皮蟹勇闯天涯2026/7/10
相关事实
待验证Meta的Voicebox和Google的AudioPaLM是尝试将感知-理解-生成链路压缩进单一Transformer架构的语音系统82% 相似待验证端到端语音架构的代表性工作包括Google的AudioLM、Meta的Voicebox以及OpenAI Realtime API79% 相似待验证Google 的 AudioPaLM 是直接实现音频到音频映射的端到端语音模型78% 相似待验证语音编码器 + LLM 解码器的组合是 2023 年以来语音大模型的主流范式,Qwen-Audio、Gemini Audio、Phi-4-audio 等均采用类似设计73% 相似待验证Google的AudioLM(2022)和Meta的SeamlessM4T(2023)验证了直接在音频域进行建模的可行性73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/500220API
curl https://kongchang.com/api/v1/knowledge/claims/500220MCP
get_claim(id=500220)