待验证50% 置信事实精确时间
Google于2023年发布的AudioPaLM率先将语音token直接注入语言模型词汇表,实现文本与音频在同一表示空间中联合建模
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证端到端语音架构的早期探索可追溯到2014年前后Google提出的Sequence-to-Sequence模型,以及2016年百度提出的Deep Speech 278% 相似待验证工具增强语言模型(Tool-Augmented Language Model,TALM)最早的系统性论述可追溯至 2022 年 Google 发表的同名论文70% 相似待验证Google 的 Universal Speech Model(USM)支持超过 100 种语言68% 相似待验证谷歌近期发布了 DiffusionGemma 技术报告,将扩散生成机制引入语言建模66% 相似待验证谷歌翻译早期的重大突破很大程度上依赖海量平行语料库(双语成对文本)66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/520896API
curl https://kongchang.com/api/v1/knowledge/claims/520896MCP
get_claim(id=520896)