[控场AI]
· 4 分钟阅读· 2,069 字

谷歌发布Gemini 3.8 Live:可边聊边思考的对话式AI

谷歌发布Gemini 3.8 Live:可边聊边思考的对话式AI

谷歌推出Gemini 3.8 Live系列,主打对话与深度思考后台并行、不打断交互流畅感。

谷歌宣布推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款对话式AI模型,定位为「最强对话式AI」。其核心卖点是打破传统「回合制」交互的停顿感,让模型能在对话进行的同时于后台完成思考与任务处理。标准版侧重实时流畅度,Extended Thinking 版则对标行业推理模型趋势,投入更多计算资源以提升复杂任务的准确性。二者结合代表了谷歌调和「低延迟对话」与「深度推理」这一固有矛盾的最新尝试。不过目前信息仅来自官方预告推文,技术细节、性能基准与定价均尚未披露,实际效果有待验证。

谷歌近日在社交平台宣布推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款新模型,官方称其为迄今为止「最强的对话式 AI」。核心卖点在于模型能够一边对话、一边思考,并在后台处理任务,而不会打断用户的交互节奏。

新模型的核心定位

从官方描述来看,Gemini 3.8 Live 系列瞄准的是「自然对话」这一长期难题。传统语音或对话式 AI 往往存在明显的「回合制」体验:用户说完一句,模型停顿处理,再给出回应。这种一问一答的节奏会打断真实交流的连贯感。

谷歌此次强调的关键词是 flow(流畅感)。官方表述指出,模型能够「talk, think, and handle tasks in the background without breaking your flow」——即在不打断对话流的前提下完成说话、思考与后台任务处理。这意味着模型可能采用了并行处理的架构,让思考和交互不再是串行的两个阶段。

两个版本的差异

此次一次性推出了两个版本,命名上的区别透露了设计思路:

Gemini 3.8 Live

标准版本,主打实时对话能力,适合日常交互场景,在响应速度与流畅度之间取得平衡。

Gemini 3.8 Live Extended Thinking

带有「Extended Thinking(扩展思考)」标签的版本,顾名思义会投入更多推理资源。这与近年来业界流行的「推理模型」趋势一致——通过让模型在给出答案前进行更深入、更长时间的思考,来提升复杂任务的准确性。

将「实时对话」与「扩展思考」结合在同一产品线中,是一个值得关注的取舍。对话式 AI 通常要求低延迟,而深度思考往往需要更多计算时间,二者存在天然张力。谷歌似乎试图通过「后台处理」的方式来调和这一矛盾,即让模型在对话进行的同时,于后台持续推进更复杂的推理与任务。

「推理模型」(Reasoning Model)是近两年大模型领域的重要范式转变。其核心思想源自「Chain-of-Thought(思维链)」研究:让模型在输出最终答案之前,先生成一段中间推理过程,从而在数学、逻辑、编程等复杂任务上显著提升准确率。OpenAI 的 o1/o3 系列、DeepSeek广告-R1、以及谷歌自家的 Gemini 2.0 Flash Thinking 都属于这一路线。Extended Thinking 的代价通常是延迟——模型需要数秒乃至数十秒的「思考时间」才能作答。将这一机制嵌入实时对话场景,意味着需要在用户感知不到停顿的情况下完成推理,这正是此次「后台处理」设计所要解决的核心工程挑战。

背后的产品逻辑

对话式 AI 的竞争已从「能否听懂」进入「是否自然」的阶段。用户对语音助手的期待越来越接近与真人交流的体验——可以随时打断、无需等待长时间停顿、能够在交谈中处理多线任务。

Gemini 3.8 Live 强调「不打断你的节奏」,正是对这一需求的回应。如果模型确实能在对话过程中于后台完成检索、计算或任务执行,那么它就能在不牺牲流畅度的前提下提供更强的实用性。这对于语音助手、客服、实时协作等场景具有直接价值。

「工具调用(Tool Use / Function Calling)」与「外部集成」是判断后台处理能力上限的关键维度。现代对话式 AI 的实用性很大程度上取决于模型能否在对话中途调用搜索引擎、执行代码、读写文件或触发第三方 API。若 Gemini 3.8 Live 的后台处理仅限于内部推理,其实用场景相对有限;若能在不打断语音对话的同时完成真实的工具调用与结果整合,则代表着向「AI Agent(智能体)」方向的实质性迈进。这也是当前各大厂商——包括 OpenAI 的 Realtime API、微软 Copilot 语音模式——共同竞争的核心能力层。

需要保持的谨慎

目前公开的信息仅来自官方的一条预告推文,尚缺乏具体的技术细节、性能基准、上下文长度、可用平台以及定价等关键信息。官方以「🧵」(长推文串)形式发布,意味着更多细节可能在后续内容中展开。

因此,对于以下问题目前仍无法给出确切答案:

  • 「后台处理任务」具体指哪些能力,是否包括工具调用与外部集成
  • Extended Thinking 版本在延迟上的实际表现
  • 两个版本的开放范围与接入方式

在完整的产品文档或评测出现之前,这些宣传亮点更适合作为方向性参考,而非最终结论。真正的能力边界,仍需等待实际使用体验来验证。

小结

Gemini 3.8 Live 与 Extended Thinking 版本代表了谷歌在对话式 AI 上的最新尝试:把「实时交互」与「深度思考」放进同一套体验里,用后台并行处理来减少交互中的停顿感。这一方向切中了当前语音与对话产品的核心痛点。不过在更多技术细节披露之前,其实际效果仍有待观察。

分享:

相关推荐