Gemini 3.5 Transcribe发布:多说话人识别与85+语言转录能力详解

Google发布Gemini 3.5 Transcribe,以语音意图理解为核心,支持多说话人、85+语言及自定义词汇适配。
Google正式推出Gemini 3.5 Transcribe语音转录模型,核心定位是从"识别文字"升级为"理解语音意图"。该模型具备三项关键能力:多说话人场景的识别与理解、85种以上语言的零配置自动检测、以及面向专业领域的自定义词汇适配。在接入方式上,Google采取"API+消费级应用"双线策略,已在Google AI Studio开放API调用,同时覆盖企业版Gemini、macOS端Gemini App及Android端Rambler应用。从行业意义看,这款模型标志着语音AI评估体系从字词错误率(WER)向意图理解的转变,有望成为智能会议系统、多语言客服平台等高价值应用的基础底座,并在与OpenAI Whisper等竞争对手的角逐中进一步推动整个语音AI赛道的技术演进。
Google推出Gemini 3.5 Transcribe
Google正式发布了全新的语音转录模型——Gemini 3.5 Transcribe。作为Gemini家族在语音理解领域的最新成员,这款模型不仅仅是简单的语音转文字工具,更强调对用户语音意图的深度理解。这意味着开发者可以基于它构建能够真正"听懂"用户的应用,而不只是机械地记录声音。
从官方披露的信息来看,Gemini 3.5 Transcribe瞄准的是当前语音识别技术的几个核心痛点:多说话人场景处理、多语言支持,以及专业领域术语的准确识别。这些恰恰是过去语音转录工具在实际落地时最容易出问题的地方。

Gemini 3.5 Transcribe三大核心能力解析
多说话人场景识别与理解
传统的语音转录在面对会议、访谈、多人对话等场景时,往往难以区分不同的说话人,导致文本混乱、难以阅读。Gemini 3.5 Transcribe明确支持**多说话人(multiple speakers)**的识别与理解,能够在同一段音频中区分不同发言者的语音并理解其意图。
这一能力对于会议纪要生成、客服质检分析、播客转录等实际应用场景意义重大。它让语音转录从"单人独白"的理想场景,真正走向了复杂的现实对话环境。
85+种语言的自动检测
多语言支持一直是全球化应用的刚需。Gemini 3.5 Transcribe开箱即支持85种以上语言的自动检测(auto-detection),无需开发者手动指定语言类型,模型可以自行判断音频所使用的语言。
这种"零配置"的多语言能力大幅降低了跨语言应用的开发门槛。对于面向国际市场的产品而言,一套API接口即可覆盖绝大多数目标用户群体的语言需求,极大简化了多语言语音识别的部署流程。
自定义词汇适配功能
专业领域的语音识别常常受困于行业术语、专有名词、缩写词的识别错误。Gemini 3.5 Transcribe提供了**自定义词汇适配(custom vocab adaptation)**功能,允许开发者针对特定的专业术语(specialized jargon)对模型进行调整。
无论是医疗、法律、金融还是技术领域,用户都可以录入行业专属词汇表,让模型在这些垂直场景中的识别准确率显著提升。这是从通用语音模型迈向专业化应用的关键一步。
Gemini 3.5 Transcribe接入方式
Gemini 3.5 Transcribe并非停留在"预告"阶段,而是已经开放使用。开发者和用户可以通过以下渠道体验这一新能力:
- Google AI Studio:API已在Google AI Studio中正式上线,开发者可直接调用并集成到自己的应用中。
- Gemini Enterprise:面向企业客户提供,满足更高的合规与规模化需求。
- Gemini App(macOS):Mac用户可以在Gemini应用中直接体验转录功能。
- Rambler(Android):安卓用户则可通过Rambler应用进行尝试。
这种"API + 消费级应用"双线布局的策略,既照顾了开发者的集成需求,也让普通用户能够第一时间感受到语音转录技术进步带来的便利。
技术意义与语音AI行业影响
从更宏观的角度看,Gemini 3.5 Transcribe的发布反映了AI语音技术正在从"识别"向"理解"演进的趋势。过去的语音转录工具关注的核心指标是字词错误率(WER),而Gemini 3.5 Transcribe将重点放在了"理解用户语音意图"上——这代表着语音AI发展方向的一次重要转变。
当模型能够理解意图、区分说话人、适配专业术语时,它便不再只是一个转录工具,而是可以成为语音交互应用的智能底座。开发者可以在此基础上构建智能语音助手、会议分析系统、多语言客服平台等一系列高价值应用。
此外,多语言的原生支持也进一步巩固了Google在全球化AI服务上的竞争优势。在语音AI这个赛道上,OpenAI的Whisper、各类专业转录服务商都在激烈角逐,Gemini 3.5 Transcribe的加入无疑会进一步推动整个行业技术能力的提升。
总结
Gemini 3.5 Transcribe以"语音意图理解"为核心卖点,配合多说话人处理、85+语言自动检测和自定义词汇适配三大能力,为语音应用开发提供了更强大的基础设施。对于开发者而言,现在可以通过Google AI Studio进行API调用和集成测试;对于普通用户,也可以在macOS或Android端的应用中直接体验转录效果。
随着语音成为人机交互越来越重要的入口,这类兼具准确性与理解力的语音模型,有望成为下一代智能应用的标配组件。
相关推荐

RAG做不好GTM智能体的原因:从信息检索到专家推理的跃迁
单靠RAG检索增强生成无法构建高效的GTM智能体。本文深入分析GTM知识的特殊性——模式识别而非事实检索,并探讨如何将操作者经验知识转化为可推理的智能体能力,实现从信息检索到专家推理的跃迁。

48小时150美元造SaaS:为智能体而非人构建的新范式
一位SaaS创作者用Grok 4.6在48小时内、150美元Token成本从零构建完整SaaS产品。深度解析其技术选型、产品决策与核心方法论——为什么未来的SaaS应该为AI智能体而非人类用户构建。

AI Agent是什么?一文搞懂智能体的本质与局限
AI Agent(智能体)到底是什么?它和大模型有什么区别?本文用通俗易懂的语言解析Agent的核心原理——任务拆分、规则设计与大模型调用,帮你建立正确的认知框架,避免被"神话"误导。