Gemini 4 Argon
谷歌DeepMind发布的旗舰前沿大模型,支持最高100万Token输出,专注于软件工程、法律金融企业知识工作及网络安全防御场景,具备长时程深度推理能力
Core Facts
Timeline (last 90 days)
谷歌发布了全新前沿AI模型Gemini 4 Argon,定位为前沿级AI模型(Frontier AI model)
Gemini 4 Argon将在受控阶段之后逐步扩大可用范围,普通用户和开发者需等待后才能接触
防御先行、分阶段放开的策略可能成为未来高能力模型发布的一种范式
谷歌称Gemini 4 Argon在多项关键能力上实现了巨大飞跃
在一项生成支付卡交易完成动画的SVG模拟测试中,Gemini 4 Argon击败了Fable 5
在Arena评测中Argon在Text Arena以1525分排名第一,但在衡量网页开发的Code Arena只排第八
Argon在Deep SWE V1得分77.9%、Automation Bench得51.3%、LV Bench得91.7%、法律智能体评测得19.6%
Argon在量子算法优化案例中让一个瓶颈子程序的时空资源开销相比已发表基线改进了40%
在Artificial Analysis的AA Omniscience测试中Argon幻觉率为15%(智能指数45分及以上模型里最低),准确率为50%低于Astra的63%,Argon更倾向于承认不知道而非给出错误猜测
Argon的单次输出上限从6.4万Token扩展到100万Token
40 more timeline events
All Facts (20)
Gemini 4 Argon 采取分阶段推出策略,目前仅通过面向网络安全防御者的 Fairwind 项目开放,尚未对公众全面开放
90%VerifiedGemini 4 Argon被谷歌定位为专为编程和网络安全工作打造的'主力型'模型(workhorse)
90%VerifiedGoogle 表示引导期结束后 Gemini 4 Argon 价格将上调至每百万输入 4 美元、输出 20 美元,对标 Opus 5.5 级别
80%VerifiedGemini 4 Argon的最大输出从64000 Token提高到100万(指输出上限而非上下文窗口)
80%VerifiedArgon入门定价为每百万输入Token 2美元、每百万输出Token 10美元,缓存输入Token享受95%折扣
80%VerifiedArgon智能体正在将谷歌内部C/C++代码库迁移到Rust,规模扩展到Fuchsia OS Zircon内核的80万行以上
75%VerifiedGemini 4 Argon聚焦软件工程、法律与金融企业知识工作、网络安全防御三大高价值场景
75%Verified分层模型策略本质是将推理算力按任务复杂度动态分配,轻量模型推理速度可达旗舰模型的5-10倍,成本低至十分之一
75%Verified在 Automation Bench 上 Gemini 4 Argon 得分 51.3%,超过 Fable 5.1 的 31.4% 和 Opus 5.5 的 42.5%
70%Verified谷歌在其官方博客上发布了 Gemini 系列的新成员 Gemini 4 Argon
90%VerifiedGemini 4 Argon宣称支持100万token的输出能力
65%VerifiedArgon智能体接管数据中心遥测数据分析,一次动作释放超过300TB内存空间
65%Partially VerifiedGemini 4 Argon在Deep7e长流程软件工程测试中取得77.9%的新记录,超越Claude Opus 5.5
70%UnverifiedArgon在长视频理解基准LV Bench上取得91.7%的成绩
60%Unverified谷歌对Argon的思维链监控中发现越界想法时,故意不将监控发现反馈进模型训练过程,以避免欺骗性对齐
60%UnverifiedArgon在CWE Bench漏洞修复测试中以68%并列第一
60%Unverified谷歌延续了以化学元素命名内部模型版本的惯例,Argon(氩)作为代号出现
60%Partially Verified谷歌DeepMind发布新一代前沿大模型Gemini 4 Argon,定位为能在复杂长周期专业工作流中持续深度推理的旗舰模型
75%Unverified谷歌称Gemini 4 Argon在多项关键能力上实现了巨大飞跃
50%UnverifiedGemini 4 Argon将在受控阶段之后逐步扩大可用范围,普通用户和开发者需等待后才能接触
50%