Unverified50% confidenceFactExact time
谷歌以往的语音识别能力主要以 Cloud Speech-to-Text API 的形式提供,偏向企业与开发者的后端集成
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified谷歌拥有来自 YouTube、搜索语音输入、Android 系统的全球规模最大的多语言语音数据积累,构成训练数据层面的护城河75% similarUnverifiedGoogle于2023年发布的AudioPaLM率先将语音token直接注入语言模型词汇表,实现文本与音频在同一表示空间中联合建模74% similarUnverifiedGoogle Cloud Vision API对印度语系支持相对较好,天城文识别效果在商业方案中位居前列74% similarUnverifiedGoogle的Speech-to-Text、微软Azure Speech Services、Deepgram等服务商提供低延迟的实时转录能力73% similarUnverified端到端语音架构的早期探索可追溯到2014年前后Google提出的Sequence-to-Sequence模型,以及2016年百度提出的Deep Speech 269% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/915976API
curl https://kongchang.com/api/v1/knowledge/claims/915976MCP
get_claim(id=915976)