Gemini
Gemini是Google DeepMind开发的多模态大语言模型系列,能够理解和生成文本、图像、音频、视频及代码等多种形式的内容。该系列涵盖不同规模的版本(如Ultra、Pro、Flash、Nano),可部署于云端服务及移动端设备,广泛应用于对话助手、内容生成、编程辅助等场景,是Google核心AI产品和服务的基础底层模型。
Core Facts
多模态AI模型能够同时处理和理解文本、图像、音频和视频等多种数据类型
Google通过Google AI Studio和Vertex AI两个平台提供Gemini模型的API访问,其中Google AI Studio为开发者提供了一定的免费调用额度
GPT-3时代的上下文窗口仅有2,048个Token,而Google Gemini已支持百万级Token,Claude支持200K Token,GPT-4 Turbo支持128K Token
Timeline (last 90 days)
Google将Gemini集成到Chrome,Microsoft将Copilot集成到Edge
TrueForge 支持接入 OpenAI、Anthropic、Gemini,也能通过指定 base URL 添加自定义 provider(如 Ollama 本地模型)
用户可以用语音搜索Gmail收件箱、在Keep中整理想法和待办事项、以及创建新的Docs文档
Google正在为Gemini推送新的语音交互能力,覆盖Gmail、Keep和Docs三大工具
AIDailyBrief.ai网站的主题提取功能直到Gemini和GPT-5.6级别的模型出现才真正可靠够用
Cursor 目前支持的模型阵容涵盖 OpenAI GPT-4o 系列、Anthropic Claude 3.x 系列、Google Gemini 系列以及部分开源模型
Google AI Studio是Google面向开发者提供的Gemini模型网页端测试平台,用户可以直接在浏览器中调用Gemini系列模型,无需本地IDE环境
在Google的Antigravity IDE中调用Gemini系列模型时,部分用户遇到请求直接失败的情况,测试指向IP地址是关键变量
Muse是Meta于2025年推出的多模态AI助手,定位类似于OpenAI的ChatGPT或Google的Gemini
Zoom AI Companion、Microsoft Copilot for Teams、Google Meet的Gemini摘要功能代表视频会议平台的原生内置AI记录路线
40 more timeline events
All Facts (20)
多模态AI模型能够同时处理和理解文本、图像、音频和视频等多种数据类型
90%VerifiedGoogle通过Google AI Studio和Vertex AI两个平台提供Gemini模型的API访问,其中Google AI Studio为开发者提供了一定的免费调用额度
90%VerifiedGPT-3时代的上下文窗口仅有2,048个Token,而Google Gemini已支持百万级Token,Claude支持200K Token,GPT-4 Turbo支持128K Token
90%VerifiedClaude的上下文窗口为200K token,Gemini支持百万级token窗口
90%VerifiedGemini是Google于2023年底发布的多模态大语言模型系列
90%VerifiedGemini是Google DeepMind于2023年底发布的多模态大语言模型,具备处理文本、图像、音频、视频和代码的能力
90%VerifiedGemini 1.5 Pro的上下文窗口达到了1M token
90%VerifiedGPT-4V、Claude 3、Gemini是现代多模态大模型的代表,能够同时处理文本、图像等多种数据类型
90%VerifiedGemini系列从训练阶段就将多种模态联合建模,而非像GPT-4V等方案那样后接视觉编码器
90%VerifiedGPT-4、Claude、Gemini等大语言模型的核心工作原理是基于Transformer架构的下一个token预测
90%Verified2024年发布的GPT-4o将图像生成能力直接整合进多模态大语言模型中
85%VerifiedNotable examples of Large Language Models include OpenAI's GPT series, Google's Gemini, Anthropic's Claude, and Meta's LLaMA.
80%VerifiedAnthropic Claude 和 Google Gemini 随后跟进支持了工具调用能力
80%VerifiedGemini 1.5 Pro 由 Google DeepMind 开发,具备原生多模态能力和与 Google Workspace 的深度集成
80%VerifiedGoogle将Gemini深度整合进搜索、Workspace、Android等既有产品矩阵
80%VerifiedGPT-4、Claude等大语言模型的代码生成能力源于训练数据中包含了GitHub上数以亿计的开源代码库
80%VerifiedGemini CLI是谷歌推出的开源终端AI编码智能体
80%VerifiedGemini系列从设计之初就是多模态原生的,将文本、图像、音频、视频等不同模态的数据统一编码到同一个特征空间中
80%VerifiedOpenAI API的接口规范已成为AI行业事实上的通信标准,包括Anthropic、Google、Mistral在内的众多模型提供商都提供兼容该格式的接口
80%VerifiedGemini 3.5 Transcribe 是 Gemini 系列在语音处理方向的延伸,主打「精准」与「智能」两大核心能力
75%