谷歌 Gemini 3.8 Live 双模型发布:语音对语音基准与定价解析

谷歌推出速度与推理双线并行的音频到音频语音模型,刷新语音基准并支持后台工具并行调用。
谷歌于9月15日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款音频到音频语音模型,分别以低延迟和高推理能力覆盖不同应用场景。标准版首字延迟仅1.18秒,Speech-to-Speech Index得分76.0;Extended Thinking版引入延展思考机制,得分82.6位居榜单第一。两款模型均支持后台工具执行,可在对话进行时并行调用外部API,消除传统语音模型的对话卡顿问题。谷歌采用按分钟计费模式,贴合语音应用的成本结构。这次双产品线策略标志着语音交互市场正从「能用」走向「好用」,开发者可通过 Live API 按场景灵活选择合适模型。
谷歌在 9 月 15 日一口气推出两款音频到音频(audio-to-audio)语音模型——Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。前者主打低延迟实时交互,后者以更强的推理能力刷新了语音对语音(Speech-to-Speech)基准榜单。两款模型都支持后台工具执行(background tool execution),这意味着模型可以在对话进行的同时调用外部工具,而不打断语音流。

两款模型的定位差异
谷歌这次的策略是用两款模型覆盖不同场景:一款追求速度,一款追求深度。
Gemini 3.8 Live 的 Speech-to-Speech Index 得分为 76.0,首个音频输出延迟仅 1.18 秒。对于实时语音助手、客服机器人、语音导航这类对响应速度敏感的应用来说,1.18 秒的首字延迟已经接近人类自然对话的节奏,用户几乎感受不到明显的等待。
Gemini 3.8 Live Extended Thinking 则把 Speech-to-Speech Index 推到了 82.6,位居榜单第一。顾名思义,这款模型引入了「延展思考」机制,在生成语音回应前会进行更充分的推理。代价是延迟会相应增加,但换来的是更准确、更有逻辑的回答,适合需要复杂推理或多步任务的语音场景。
什么是「音频到音频」
传统语音交互的链路通常是「语音识别 → 文本处理 → 语音合成」三段式,每一段都会引入延迟与信息损失。而音频到音频模型直接在音频层面完成理解与生成,跳过了中间的文本转换环节,从而在延迟、语气还原和情感表达上都有优势。这也是 Gemini 3.8 Live 能做到亚秒级首字延迟的技术基础。
音频到音频架构的核心优势还在于能够保留语音中的副语言信息(paralinguistic information),包括说话者的语气、情绪、停顿节奏、语速变化等。传统三段式链路在语音识别阶段就将这些信息丢弃,转化为「纯文本」后再合成语音时只能重新猜测或套用默认语调。端到端的音频模型则可以在输入和输出之间保留这些细节,使回应在情感上更自然。目前业界在这一方向上进展迅速,OpenAI 的 GPT-4o 语音模式、ElevenLabs 的实时对话 API 也采用了类似理念,音频到音频正从研究前沿演变为工程实践的标准路径。
后台工具执行的价值
两款模型都内置了后台工具执行能力,这是本次更新中值得关注的工程特性。
在过去,语音模型要调用外部工具(比如查询天气、检索数据库、执行 API 调用)时,往往需要中断当前的语音输出,等工具返回结果后再继续。这会造成明显的对话卡顿。后台工具执行让模型可以在「说话」的同时并行处理工具调用,把等待时间隐藏在自然的对话节奏里,显著提升了交互的流畅度。
对开发者而言,这意味着可以构建真正意义上的「边说边做」的语音智能体,例如一边和用户确认订单细节、一边在后台完成库存查询和下单操作。
基准表现与定价
从公布的基准数据看,Extended Thinking 版本以 82.6 的 Speech-to-Speech Index 拿下第一,标准版 76.0 的成绩也处于第一梯队。两者的差距主要体现在推理深度与延迟之间的取舍。
谷歌为这两款模型采用了按分钟计费(per-minute pricing)的模式,这与常见的按 token 计费不同,更贴合语音应用的实际使用场景。语音应用的成本往往与通话时长直接相关,按分钟计费让开发者更容易预估和控制成本。
如何基于 Live API 构建应用
开发者可以通过 Live API 接入这两款模型。构建语音应用时,需要根据场景权衡:
- 追求实时性(客服、语音助手、实时翻译):优先选择 Gemini 3.8 Live,利用其 1.18 秒的低延迟;
- 追求准确性(复杂咨询、教育辅导、多步任务):选择 Extended Thinking 版本,用可接受的延迟换取更高质量的回答;
- 善用后台工具执行:把耗时的 API 调用放到后台并行处理,保持对话不中断。
Speech-to-Speech Index(S2S Index)是专门用于衡量语音对语音模型综合能力的评估基准,通常涵盖语音理解准确率、响应相关性、自然度评分以及首字输出延迟等多个维度的加权综合得分。与纯文本基准(如 MMLU、HumanEval)不同,S2S Index 需要同时评估模型的听觉理解能力和语音生成质量,因此更能反映语音应用的真实用户体验。目前该榜单由谷歌维护并公开,Extended Thinking 以 82.6 分占据榜首,意味着它在推理质量和语音自然度的综合表现上超越了此前的所有公开模型。按分钟计费相较于按 token 计费,对于高频短句场景(如客服对话)可能成本更高,开发者在选型时仍需结合自身业务的通话时长分布进行测算。
行业意义
谷歌同时推出速度型与推理型两款语音模型,反映出语音交互市场正在从「能用」走向「好用」的阶段竞争。延迟与推理质量这对天然矛盾,过去只能二选一,如今厂商开始用产品线细分的方式让开发者按需选择。
随着音频到音频架构逐渐成为主流,加上后台工具执行这类工程优化,语音智能体的实用性边界正在被快速拓宽。对于正在评估语音技术栈的团队来说,Gemini 3.8 Live 系列提供了一个兼顾速度、质量与成本可控性的新选项。
相关推荐

西伯利亚冰雪公主与斯基泰世界的考古之谜
西伯利亚冰雪公主是阿尔泰乌科克高原冰封墓葬中出土的斯基泰女性木乃伊,其纹身、丝绸与随葬品揭示了古代游牧文明的艺术、社会结构与跨区域交流。本文梳理其考古价值与相关争议。

SQL 行模式匹配:用 MATCH_RECOGNIZE 实现"行级正则"
MATCH_RECOGNIZE 让 SQL 拥有"行级正则"能力,用类正则语法匹配连续行序列,轻松检测暴力破解、交易异常、用户行为路径等顺序模式,告别繁琐的自连接与窗口函数。

黑客攻入Flock监控摄像头,暴露车牌识别系统内幕
黑客成功入侵Flock Safety的车牌识别监控摄像头,暴露了ALPR系统的内部运作机制。本文解析事件经过、系统工作原理及其引发的隐私与数据安全争议。