待验证50% 置信事实精确时间
谷歌以往的语音识别能力主要以 Cloud Speech-to-Text API 的形式提供,偏向企业与开发者的后端集成
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证谷歌拥有来自 YouTube、搜索语音输入、Android 系统的全球规模最大的多语言语音数据积累,构成训练数据层面的护城河75% 相似待验证Google于2023年发布的AudioPaLM率先将语音token直接注入语言模型词汇表,实现文本与音频在同一表示空间中联合建模74% 相似待验证Google Cloud Vision API对印度语系支持相对较好,天城文识别效果在商业方案中位居前列74% 相似待验证Google的Speech-to-Text、微软Azure Speech Services、Deepgram等服务商提供低延迟的实时转录能力73% 相似待验证端到端语音架构的早期探索可追溯到2014年前后Google提出的Sequence-to-Sequence模型,以及2016年百度提出的Deep Speech 269% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/915976API
curl https://kongchang.com/api/v1/knowledge/claims/915976MCP
get_claim(id=915976)