Gemini Live API
Google 提供的实时多模态 API,支持语音、视频流式交互,可与函数调用能力结合,用于构建具备实时感知和行动能力的 AI 助手应用。
时间轴 (近 90 天)
上述能力现已在Gemini Live API中开放,开发者可直接使用
谷歌为 Gemini Live API 更新,首次将前沿级推理(frontier-level reasoning)引入原生音频交互体验
Gemini Live API 本次更新包含异步函数调用、主动式音频、上下文注入和后台推理等功能
主动式音频(proactive audio)功能允许开发者和用户提示智能体只在相关或被点名时才作出回应
异步函数调用(async function calling)允许长耗时工具在后台运行,同时智能体继续与用户交谈
这些新功能现已开放供开发者使用
上下文注入通过 send client content 向对话注入客户端内容,而不强制触发一次对话回合(turn)
Google 在技术演示视频中展示了利用 Gemini Live API 与函数调用,借助 Firebase AI Logic 构建实时烹饪助手 App Friendly Meals
通过 Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台可帮助开发者构建语音界面
全部知识事实 (9)
主动式音频(proactive audio)功能允许开发者和用户提示智能体只在相关或被点名时才作出回应
60%待验证异步函数调用(async function calling)允许长耗时工具在后台运行,同时智能体继续与用户交谈
60%待验证上下文注入通过 send client content 向对话注入客户端内容,而不强制触发一次对话回合(turn)
60%待验证通过 Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台可帮助开发者构建语音界面
50%待验证上述能力现已在Gemini Live API中开放,开发者可直接使用
70%待验证Gemini Live API 本次更新包含异步函数调用、主动式音频、上下文注入和后台推理等功能
60%待验证谷歌为 Gemini Live API 更新,首次将前沿级推理(frontier-level reasoning)引入原生音频交互体验
50%待验证这些新功能现已开放供开发者使用
50%待验证Google 在技术演示视频中展示了利用 Gemini Live API 与函数调用,借助 Firebase AI Logic 构建实时烹饪助手 App Friendly Meals
50%