待验证50% 置信发布精确时间
谷歌推出macOS端语音笔记应用Google AI Edge Foresight,搭载Gemma系列与Embedding Gemma模型,转录时语音由本地模型处理
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/8
首次发现
有效期至:2027/1/6
来源
涉及实体
相关事实
待验证端到端语音架构的早期探索可追溯到2014年前后Google提出的Sequence-to-Sequence模型,以及2016年百度提出的Deep Speech 267% 相似待验证Google于2023年发布的AudioPaLM率先将语音token直接注入语言模型词汇表,实现文本与音频在同一表示空间中联合建模67% 相似待验证谷歌以往的语音识别能力主要以 Cloud Speech-to-Text API 的形式提供,偏向企业与开发者的后端集成66% 相似待验证EmbeddingGemma 2 是谷歌基于 Gemma 4 架构打造的多模态嵌入模型,能够将文本、图像、音频和视频编码到共享的 768 维向量空间中65% 相似待验证Google Brain团队2012年发表了DNN-HMM混合模型,代表深度神经网络语音识别系统63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/988720API
curl https://kongchang.com/api/v1/knowledge/claims/988720MCP
get_claim(id=988720)