Unverified50% confidenceFactExact time
Google于2023年发布的AudioPaLM率先将语音token直接注入语言模型词汇表,实现文本与音频在同一表示空间中联合建模
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified端到端语音架构的早期探索可追溯到2014年前后Google提出的Sequence-to-Sequence模型,以及2016年百度提出的Deep Speech 278% similarUnverified工具增强语言模型(Tool-Augmented Language Model,TALM)最早的系统性论述可追溯至 2022 年 Google 发表的同名论文70% similarUnverifiedGoogle 的 Universal Speech Model(USM)支持超过 100 种语言68% similarUnverified谷歌近期发布了 DiffusionGemma 技术报告,将扩散生成机制引入语言建模66% similarUnverified谷歌翻译早期的重大突破很大程度上依赖海量平行语料库(双语成对文本)66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/520896API
curl https://kongchang.com/api/v1/knowledge/claims/520896MCP
get_claim(id=520896)