[控场AI]
· 4 分钟阅读· 2,333 字

谷歌发布 Gemini 3.8 Live Avatar:会看会说的实时数字人

谷歌发布 Gemini 3.8 Live Avatar:会看会说的实时数字人

谷歌推出 Gemini 3.8 Live Avatar,将实时语音与低延迟视频原生耦合,打造能听说看且支持97种语言的企业级数字人。

谷歌在 Gemini 3.8 Live 基础上推出 Live Avatar 功能,将实时语音对话与低延迟视频生成原生耦合,实现精准唇形同步、自然面部表情和流畅轮流对话的数字人体验。技术层面,异步工具调用使 Avatar 可在后台执行数据查询等操作的同时保持对话不中断;多语言语音到语音同步支持97种语言的无缝动态切换,且不损失视频保真度。企业可基于参考图定制品牌专属 Avatar(目前通过白名单开放),所有输出均内嵌 SynthID 隐形水印以确保 AI 内容可追溯。该功能目前已在 Gemini Enterprise 中上线,主要面向客户服务、导览、培训等需要虚拟形象交互的企业场景。

谷歌为其 Gemini 对话式 AI 带来了一项引人注目的升级——Gemini 3.8 Live with Live Avatar。这项功能在上周 Gemini 3.8 Live 发布的基础上,进一步引入了近实时的视觉呈现能力,让 AI 不再只是一个声音,而是一个能听、能看、能说、还能通过面部表情交流的动态虚拟形象。目前,该功能已在 Gemini Enterprise 中面向企业用户开放。

Gemini 3.8 Live with Live Avatar

从语音对话到视觉临场

Live Avatar 的核心思路,是把 Gemini 已有的实时对话能力与低延迟流媒体视频原生耦合在一起。换句话说,它并非简单地在语音输出上叠加一个动画头像,而是让视频生成与语音输出在近实时层面同步进行。

结果是一个具备精准唇形同步、自然表情和流畅轮流对话(turn-taking)的虚拟角色。谷歌研究科学家 Shuo-yiin Chang 与工程师 CJ Zheng 代表 Gemini Audio 团队表示,这种设计让企业能够以更具互动性的方式扩展虚拟服务,无论是客户服务还是交互式演示,都能把原本单调的数字交互变成更丰富、更易接近的体验。

真正的多模态对话

谷歌强调,对话本质上就是多模态的:人类在交流时会同时倾听、观察、说话,并借助面部表情传递信息。Live Avatar 试图把这些能力带给企业级智能体。

它能够同时处理视觉与音频输入,在近实时的条件下对所见所闻做出反应,并以富有表现力的音视频输出回应。这意味着 Avatar 不只是在"念稿",而是能够根据摄像头看到的内容和用户说的话,做出相应的表情和语气变化,从而营造更接近真人交流的临场感。

后台异步执行,对话不中断

视觉临场之外,Live Avatar 背后还依托 Gemini 的高级推理能力。这里一个值得关注的技术点是异步工具调用(asynchronous tool calling)。

传统的对话式 AI 在需要查询数据或执行操作时,往往会出现明显的停顿——AI 得"想一想"或"查一查"才能继续。而 Live Avatar 可以在后台触发工具调用、获取数据的同时,继续保持活跃对话,从而在处理复杂任务时依然维持不间断的交流流。谷歌给出的示例是酒店入住办理:Avatar 一边和客人交谈,一边在后台完成登记查询等操作,整个对话过程流畅无停顿。

异步工具调用(Asynchronous Tool Calling)是一种并发执行模式:主对话线程与后台工具调用线程相互独立、互不阻塞。与之对应的同步模式则要求系统在工具返回结果之前暂停所有输出,这正是传统对话 AI 会出现明显"等待停顿"的根本原因。在实现上,异步调用通常借助事件循环或消息队列机制,让模型在等待外部 API 响应(如数据库查询、预订系统调用)的同时,可以继续生成过渡性语音输出,保持对话的流畅节奏。对企业级场景而言,这一能力尤为关键——真实的业务流程往往涉及多步骤、多系统的操作,如果每次调用都引发停顿,会显著破坏用户体验并拉低任务完成效率。

97 种语言的无缝切换

面向全球规模的部署,Live Avatar 内置了原生的多语言语音到语音(speech-to-speech)同步能力。它能够在对话中途动态切换语言,并让唇形同步和面部表情随之自适应调整。

谷歌称,该功能可在 97 种语言之间无缝过渡,且不会降低视频保真度或引入视觉漂移(visual drift)。对于跨国企业而言,这意味着一个数字人形象可以服务不同语言背景的用户,而无需为每种语言单独制作素材。

品牌定制与身份保护

企业往往需要区别于他人的视觉身份。除了提供多样化的预设 Avatar 库之外,Live Avatar 还支持定制:开发者可以基于一张高质量的参考图像,生成一个完全动画化、可响应的 Avatar,同时保留参考图的相似度、品牌风格或角色身份。不过,自定义 Avatar 创建目前仅通过企业白名单开放。

在信任与透明方面,谷歌为 Live Avatar 设置了严格的保护措施。所有由其 AI 产品生成的输出都带有 SynthID 水印,这种不可感知的水印被直接编织进音频和视频输出中,帮助确保 AI 生成内容可被检测,从而降低虚假信息和错误归属的风险。

SynthID 是谷歌 DeepMind 开发的一套 AI 内容水印技术,最初于 2023 年用于图像,后续扩展到文本、音频和视频领域。其核心原理是在生成阶段将不可感知的统计信号直接嵌入内容的比特层或语义层,而非依赖附加的元数据标签——这意味着水印在压缩、剪辑或格式转换后仍能保持可检测性。与可见水印或文件头标注相比,SynthID 的优势在于不影响内容的视听质量,同时大幅提高伪造或洗白的难度。在监管层面,随着欧盟《人工智能法案》等法规逐步要求 AI 生成内容可溯源,类似 SynthID 的隐形水印技术正成为合规部署的重要基础设施之一。

写在最后

Live Avatar 代表了对话式 AI 从"纯语音"向"视听一体化数字人"演进的一步。精准唇同步、异步工具调用与 97 种语言的无缝切换,共同指向一个更自然、更适合企业级场景的交互形态。目前该功能已在 Gemini Enterprise 上线,开发者可通过 API 文档开始接入。对于希望在客户服务、导览、培训等场景中部署虚拟形象的企业来说,这无疑是一个值得关注的新选项。

分享:

相关推荐