谷歌的 Gemini 4 Argon 在 18 个基准测试中领先 12 个,输出高达 100 万个代币,发布时每百万个代币的成本为 2/10 美元,但它首先面向网络防御者,没有任何保护措施。

谷歌 DeepMind 于 2026 年 9 月 30 日发布了 Gemini 4 Argon。它是 Gemini 4 系列中的第一个模型,谷歌称之为“新前沿模型”。的 公告,由 Google DeepMind 高级副总裁兼 Google 首席 AI 架构师 Koray Kavukcuoglu 撰写,其目标是长期工作:现实世界的软件工程、法律和财务工作以及网络安全防御。
有两个数字很引人注目。首先,输出限制从 64K 令牌变为 1M,因此单次运行可以产生“单个轨迹中数十万个令牌”。其次,在谷歌自己的比较表中,Argon 在其披露的 18 个基准测试中领先于 OpenAI 的 GPT-6 Astra 和 Anthropic 的 12 个。 克劳德作品 5.5。
问题是访问。除非您在 Google Fairwind 计划的安全团队中工作,否则您还无法使用它。
Argon 正在“通过我们的 Fairwind 计划向一组值得信赖的网络防御者推出”。 Fairwind 是一个由 Google Cloud 客户、政府机构和网络安全合作伙伴组成的值得信赖的小型团体。这些捍卫者以及谷歌的内部团队得到了一个删除了安全制动器的版本:“我们将发布没有网络护栏的 Argon,这样他们就可以利用其完整的前沿级网络安全防御能力。”谷歌表示,该模型“可以自主查找、验证和修补关键软件漏洞”。
其他人都在等待。该帖子称:“在这个级别安全地发布前沿功能需要采取分阶段的方法。”并补充说,谷歌正在“积极参与美国政府的预发布模型访问自愿流程”。接下来是付费 API 客户和 Google AI Ultra 订阅者,“尽快”。谷歌没有给出具体日期。自 2026 年 10 月 2 日起,Argon 在 Gemini 应用程序、AI Studio 或 Vertex AI 中不可用。无护栏版本仅适用于防御者,谷歌表示,在更广泛的版本发布之前,它仍在研究护栏。
一位早期用户有一个结果要展示。 Wiz 通过 Scan for Good 运行 Argon,这是其用于保护关键公共基础设施的免费计划。在早期的演示中,该模型“发现了一个严重的漏洞,该漏洞暴露了全球医院使用的医疗保健软件中的敏感个人信息”,谷歌表示,早期的前沿模型忽略了这一缺陷。在 Wiz 的内部黑盒渗透测试基准上,Argon 也击败了 Gemini 3.8 Flash Cyber。

以下所有数据均来自谷歌,转载自 创业节拍。谷歌之外还没有人可以运行该模型,因此没有人独立检查它们。
| 基准测试 | 双子座 4 氩 | GPT-6 阿斯特拉 | 克劳德作品 5.5 |
|---|---|---|---|
| 哈维的法律代理人 | 19.6% | 5.4% | 3.8% |
| 自动化工作台 | 51.3% | 41.4% | 42.5% |
| GraphWalks(256K 到 1M) | 84.2% | 71.8% | 66.8% |
| 瓦尔斯财务代理 v2 | 65.4% | 53.5% | 58.6% |
| 深SWE v1.1 | 77.9% | 74.1% | 74.2% |
| LVBench(长视频) | 91.7% | 87.5% | 83.7% |
| FrontierSWE v2 | 55.0% | 65.5% | 62.3% |
| 终端科学 0.1 | 57.6% | 68.1% | 63.3% |
| 终端工作台4.0 | 57.4% | 58.2% | 66.4% |
| 火车后长凳 | 45.3% | 44.3% | 49.3% |
法律分数是最大的差距。在 Harvey 的代理基准测试中,Argon 的得分是 GPT-6 Astra 的三倍多。损失也能说明问题。 Argon 在 FrontierSWE v2 上落后 GPT-6 Astra 10 分,在 Terminal-bench 4.0 上落后 Opus 5.5 9 分,因此对于生活在 shell 中的特工来说,这不是明显的选择。
Engadget 增加了一个外部数据点:智力指数得分为 60,与 GPT-6 Astra 相同,比 GPT-6 Astra 高出 1 分。 GPT-6.1 溶胶 模型OpenAI于同一天发布。它还报告了 15% 的幻觉率,是领先模型中最低的。

由于防御者首先获得 Argon,因此其安全分数现在最为重要。在衡量模型修复漏洞效果的 CWE-bench v1 上,Argon “以 68% 的最高分并列第一”。根据 恩杰特,与 Grok 4.7 和 GPT-6 Astra 并列。 Opus 5.5 得分 67%。

快速注入是氩气明显领先的地方。在 Grey Swan 的间接即时注入测试中,针对 Argon 的攻击成功率为 0.7%,针对 Opus 5.5 的攻击成功率为 1.0%,针对 GPT-6 Astra 的攻击成功率为 8.5%。越低越好。这大约相当于 140 次被劫持的运行一次,而被劫持的运行为 12 次。对于读取不受信任的网页或票证的代理来说,差异很重要,并且 Gemini特工以前也被这样骗过。

谷歌表示,它是在其前沿安全框架下构建 Argon 的。这包括拒绝仍然允许合法的双重用途研究、针对注入的对抗性训练、沙盒环境以及“监控 Argon 的思想和行动链的失调缓解措施”。
在推出期间,Argon 每百万个输入代币的成本为 2 美元,每百万个输出代币的成本为 10 美元。缓存输入可享受 95% 的折扣,折算为 0.10 美元。此后,价格翻倍至 4 美元输入和 20 美元输出。谷歌没有透露介绍期持续多长时间。这些是截至 2026 年 10 月 2 日 Google 公布的价格,除了 Fairwind 之外还没有人可以支付这些价格。
按照首发价格计算,Argon 的成本是 GPT-6 Astra 的五分之一(10 美元/50 美元),是 Opus 5.5 的一半(4 美元/20 美元)。按照标准价格,它的价格与 Opus 5.5 相同。更大的输出限制也是有代价的:使用全部 100 万个输出代币的一个响应现在花费 10 美元,以后花费 20 美元。让代理在没有监督的情况下运行的团队应该设置上限。
谷歌自己的团队是另一个有权访问的团队,该帖子列出了他们用它所做的事情。在量子研究中,Argon “在几分钟内”就将量子位逐门资源成本的已发布基准降低了 40%。在谷歌的数据中心,Argon 代理读取整个车队的分析数据并应用内存优化。这释放了超过 300 TiB 的内存,Google 估计总共节省了 500 TiB 到 1 PiB。
最具体的例子就是代码迁移。 Argon 代理正在将 C 和 C++ 代码库迁移到 Rust,从数万行(re2、libgav1)到 800K 多行 Fuchsia Zircon 内核。对于 libgav1,Argon 替换了现有 Rust 端口中的 32K 行 SIMD 代码。由此产生的内存安全解码器的运行速度比该端口快 2.7 倍,并且具有相同的输出。锆石迁移仍在进行中,并接受自动和手动审核。谷歌还没有发货。
目前,您无法部署任何内容。如果您基于 Gemini API 进行构建,那么今天的模型与 9 月 29 日的模型相同。请勿围绕没有公开发布日期的模型计划迁移。预算为 4 美元/20 美元,而非促销价。
当它到达时,1M 输出限制对于在一次运行中产生大量工件的作业最为重要:代码迁移、长报告、完整的测试套件。像这样的团队目前将工作分成 64K 块,然后将其重新拼接在一起。法律和财务代理人也有理由根据 Harvey 和 Vals 分数尽早进行测试。其代理主要运行终端命令的团队应继续使用 Opus 5.5 或 GPT-6 Astra,直到独立测试确认情况并非如此。
更大的变化在于发布顺序。前沿实验室首先将最强大的模型提供给网络防御者,没有护栏,同时通过政府的预发布审查,然后将其提供给付费开发人员。这件事发生在 OpenAI 的 DevDay 和 Sundar Pichai 签署的《白宫超级智能协议》的同一天。敬请留意 Google 为付费 API 客户和 Ultra 订阅者指定的日期。在那之前,上面的分数都是谷歌自己的。