[控场AI]
模型

Gemini Omni

Gemini Omni是Google开发的多模态大型AI模型,属于Gemini模型系列。该模型能够同时处理和理解文本、图像、音频、视频等多种模态的输入信息,并生成相应的多模态内容输出。其核心特征包括跨模态理解与推理能力、对现实世界物理规律的建模能力,以及在复杂多模态任务中的综合处理能力,适用于多种生成式AI应用场景。

核心事实

时间轴 (近 90 天)

6月3日

Google将于美西时间2025年6月3日上午11:30举办Gemini Omni的实时演示活动

待验证95%
6月3日

Gemini Omni演示由产品经理Chloe通过Discord平台进行直播

待验证95%
6月3日

Google选择通过Discord社区进行Gemini Omni直播演示,而非传统发布会形式

待验证95%
6月3日

Gemini Omni主打三大核心能力:多模态输入、真实世界知识和对话式编辑

待验证90%
6月2日

Google Gemini通过Gemini Omni推出了数字化身(Digital Avatar)功能,可以创建外观和声音与用户相似的虚拟形象

待验证85%
6月1日

Gemini Omni融合文本、音频、图片、视频输入,可以用自然语言进行视频创作和编辑,并可直接发布到YouTube Shorts

待验证85%
6月1日

Google I/O 2026发布的产品包括Gemini 3.5 Flash、Gemini Omni、Gemini Spark、Anti-Gravity 2.0、Search AI Mode以及AI Ultra新订阅套餐

待验证85%
5月31日

Google的Gemini Omni模型正式发布

待验证85%
5月31日

Gemini Omni发布仅一周内就引发了开发者和创作者社区的广泛关注,涌现出大量创意应用

待验证80%
5月31日

Gemini Omni的'Omni'架构核心理念与OpenAI的GPT-4o高度相似,都追求在单一模型中原生支持多模态输入输出

待验证80%

还有 19 条时间轴事件

全部知识事实 (8)

来源文章