Gemini 4 Argon 发布:百万 Token 输出,基准领先 GPT-6 Astra

Gemini 4 Argon将输出上限提升至百万Token,主攻大规模工程任务,但综合基准领先有限。
Google发布Gemini 4 Argon,最核心的升级是将单次输出上限从64000 Token提升至100万Token(约16倍),使模型能在单次会话中完成大规模代码迁移、系统级优化等长链条工程任务。Google以两个内部案例佐证:AI智能体参与了超过80万行C/C++到Rust的代码迁移,以及通过分析性能数据帮助数据中心释放逾300TB内存。在性能基准上,Argon在Deep Study软件工程测试中得分77.9%,小幅领先GPT-6 Astra和Claude Opus 5.5(约74%),但在其他编程及操作类测试中并非全面第一。价格方面,首发优惠为输入2美元、输出10美元/百万Token,优惠结束后翻倍;初期仅向Fairwind网络安全团队、付费API用户及AI Ultra订阅者开放,Pro用户暂不包含。
Gemini 4 Argon 把输出上限拉到百万 Token
Google 正式公布了 Gemini 4 Argon,最大的变化是把输出上限从 64000 Token 一举提升到 100 万 Token,约为原来的 16 倍。需要强调的是,这里说的是输出长度,也就是模型一次任务能生成多少内容,而非常见的上下文窗口(输入)长度。
输出能力的大幅扩张,直接改变了模型可以胜任的任务类型。过去受限于几万 Token 的输出上限,模型只能分段完成长篇生成或大规模代码改写;而百万级输出意味着模型可以在单次任务里产出更完整、更连贯的工程成果,减少人工拼接和上下文丢失的问题。
输出 Token 与上下文窗口的区别值得单独说明。上下文窗口(Context Window)指模型一次能"看到"的最大输入长度,决定了你能喂给模型多少历史对话、代码或文档;而输出 Token 上限则是模型在单次响应中能生成内容的天花板。此前主流大模型的输出上限普遍在 4000 到 32000 Token 之间,64000 Token 已属高端配置。将其扩展至 100 万 Token,意味着模型理论上可以在一次响应里输出约 75 万个英文单词或相当规模的代码文件——这一数量级使得完整输出一个中等规模软件项目的源码成为可能,而无需将任务拆分为多个会话分段处理。
两个内部案例:AI 开始接手真实工程任务
Google 给出了两个颇具分量的内部案例。第一个是让 AI 智能体参与把 C 和 C++ 代码迁移到 Rust,涉及的项目最高超过 80 万行代码。这类迁移任务的难点在于,改写代码的同时还要尽量保住原有功能以及模块之间的依赖关系,对模型的长程一致性要求极高。

第二个案例发生在数据中心。Google 表示,一组智能体通过分析性能信息,帮助释放了超过 300TB 的内存。这两个案例指向的是同一个方向——让 AI 参与步骤更多、耗时更长的实际工程任务,而不仅仅是写一个函数或回答一个问题。

从这两个场景可以看出,Google 想证明的核心能力是「持续、长链条的自主执行」。百万 Token 输出正是服务于这一目标:大型代码迁移和系统级优化都需要模型在一次会话里维持大量状态与产出。
C/C++ 到 Rust 的迁移是软件行业近年来的热门议题。Rust 凭借其内存安全模型(所有权系统、借用检查器)在不依赖垃圾回收的前提下消除了大量内存安全漏洞,Google、微软、Linux 内核社区等都在推动用 Rust 重写关键基础设施代码。然而手工迁移成本极高——不仅要逐行理解 C/C++ 的指针和内存管理逻辑,还要将其映射到 Rust 完全不同的所有权语义上,同时保证与周边模块的 ABI 兼容。80 万行规模意味着即便每位工程师每天能迁移 200 行,也需要一个团队工作数年,这正是 AI 辅助迁移能产生实质价值的场景。
基准表现:领先有限,选型仍看任务
在性能对比上,Argon 的表现值得拆开来看。在 Deep Study 软件工程测试里,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5——后两者都在 74% 左右。这是一个明确但幅度有限的领先。

不过这种领先有具体范围。在其他一些编程、终端操作和电脑操作类测试中,仍然有模型得分更高。换句话说,Argon 并非在所有维度上全面碾压,它的优势集中在特定的软件工程场景。对使用者来说,选模型的关键依然是明确自己要完成什么任务,而不是迷信单一榜单的排名。
这也反映出当前头部模型之间的竞争格局:没有一个模型能在全部基准上通吃,各家在不同任务维度各有擅长,实际选型更应基于具体工作负载做评测。
价格与可用范围
价格方面,按照 Google 公布的首发优惠价,每 100 万 Token 输入 2 美元、输出 10 美元。需要注意的是,这是优惠价——优惠结束后这两项价格都会翻倍。对于依赖大规模输出的工程任务,输出端 10 美元/百万 Token 的定价会直接影响长链条任务的实际成本。

可用范围则相对收紧。Argon 目前先向 Fairwind Program 中可信的网络安全团队开放,后续会优先覆盖付费 API 用户和 Google AI Ultra 订阅者。这里明确不包括 Pro 用户,普通付费订阅者暂时无法直接体验。
Fairwind Program 是 Google 面向可信网络安全研究机构和团队设立的早期访问计划,参与者通常经过背景审查,主要用于在受控环境中测试 AI 在安全敏感场景下的能力与边界。将新模型优先向该群体开放,既能收集专业反馈,也能在能力尚未完全经过公开验证前控制潜在风险。从商业策略看,网络安全是 AI 能力溢价最高的垂直赛道之一,优先覆盖该群体也有助于 Google 建立差异化的企业级口碑,再逐步向更广泛的付费用户扩展。
小结
Gemini 4 Argon 的发布信号很清晰:百万 Token 输出叠加智能体能力,Google 正在把模型推向更长、更复杂的真实工程任务。基准上的领先虽然存在,但幅度有限,且分场景。接下来真正值得关注的,是它在实际部署中能否交出经得起验证的结果,而不仅仅是内部案例和榜单数字。
相关推荐

OpenAI Dev Day 全盘点:20+ 发布背后的三大趋势
OpenAI Dev Day 一次性发布 20+ 产品,涵盖个人智能体 DOTS、GPT-6.1 Sol、Decisions API、Space 协作区与模型市场。本文全面盘点并解读其揭示的三大 AI 趋势。

只想要一个自定义域名邮箱,为何如此艰难?
拥有一个自定义域名邮箱看似简单,实则涉及 SPF/DKIM/DMARC 配置、IP 信誉、托管服务成本等诸多难题。本文梳理自建与托管方案的权衡,并给出实用建议。

Claude意外帮用户发现燃气泄漏:AI助手的安全应用边界
一位Reddit用户借助AI助手Claude识别出家中燃气泄漏隐患,PG&E上门确认并修复。本文分析AI助手在家庭安全场景中的真实价值与使用边界,以及处理燃气泄漏的正确做法。