[控场AI]
产品Gemini Live

Gemini Live API

Google 提供的实时多模态 API,支持语音、视频流式交互,可与函数调用能力结合,用于构建具备实时感知和行动能力的 AI 助手应用。

时间轴 (近 90 天)

9月19日

上述能力现已在Gemini Live API中开放,开发者可直接使用

待验证70%
9月17日

谷歌为 Gemini Live API 更新,首次将前沿级推理(frontier-level reasoning)引入原生音频交互体验

待验证50%
9月17日

Gemini Live API 本次更新包含异步函数调用、主动式音频、上下文注入和后台推理等功能

待验证60%
9月17日

主动式音频(proactive audio)功能允许开发者和用户提示智能体只在相关或被点名时才作出回应

待验证60%
9月17日

异步函数调用(async function calling)允许长耗时工具在后台运行,同时智能体继续与用户交谈

待验证60%
9月17日

这些新功能现已开放供开发者使用

待验证50%
9月17日

上下文注入通过 send client content 向对话注入客户端内容,而不强制触发一次对话回合(turn)

待验证60%
9月16日

Google 在技术演示视频中展示了利用 Gemini Live API 与函数调用,借助 Firebase AI Logic 构建实时烹饪助手 App Friendly Meals

待验证50%
9月15日

通过 Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台可帮助开发者构建语音界面

待验证50%

全部知识事实 (9)

来源文章