谷歌在 9 月 30 日发布了新一代旗舰 AI 模型 Gemini 4 Argon,但这一次,它的发布方式格外克制:首批只有通过 “Fairwind 计划” 的受信任网络安全防御者才能使用,普通开发者和消费者被挡在了门外。
限定开放的新旗舰
据 The Hacker News 10 月 1 日报道,Gemini 4 Argon 由 Google DeepMind 首席 AI 架构师兼高级副总裁 Koray Kavukcuoglu 宣布推出。谷歌官方称,该模型”在真实世界的软件工程、法律和金融等企业知识工作,以及网络安全防御等复杂工作流中展现出前沿性能”。
与 Anthropic、OpenAI 的同类模型一样,Argon 的核心能力之一是自主发现、验证和修复关键软件漏洞。谷歌透露,Argon 已经发现了一个此前未知的关键漏洞——该漏洞暴露了全球医院使用的医疗软件中的敏感个人信息。谷歌没有披露受影响软件的具体名称。
谷歌表示,与约一个月前发布的 Gemini 3.8 Flash Cyber(当时被称为”最强的网络安全模型”)相比,Argon 在漏洞发现能力上实现了”显著飞跃”,在攻击面发现和生成验证性概念验证(PoC)方面表现更出色。
为何先给防御者:能力越大,护栏越要先到
限制发布范围的关键原因在于,Argon 的网络攻击面挖掘能力是典型的”双刃剑”:在防御者手里它是修补漏洞的利器,落入攻击者手中则可能被用于规模化寻找目标系统的弱点。
谷歌为此采取了分步策略:一方面计划向受信任的防御者和内部团队提供不带网络安全护栏的 Argon 版本,以发挥其完整能力;另一方面,在更广泛的发布之前,谷歌表示正在加强防护措施——约束模型的失准行为、防止恶意行为者滥用,并提升对间接提示注入(IPI)攻击的抵抗能力。谷歌发布的模型评估显示,Argon 在 Gray Swan 的 IPI 基准测试中排名第一。
目前公众的等待还没有时间表。谷歌表示,付费 API 客户和 Google AI Ultra 订阅者将是下一批用户,但具体日期尚未公布。
价格与跑分:首发优惠价,实测居榜首
在定价上,Argon 首发定价为输入每百万 token 2 美元、输出每百万 token 10 美元,优惠期结束后涨至 4 美元和 20 美元。上下文窗口为 100 万 token。
第三方测评已经给出积极信号:Vals AI 将 Argon 评为 41 个参评模型中的第一名,Vals Index 得分 68.9%,领先 Claude Sonnet 5.5(67.04%)、Claude Opus 5.5(66.97%)和 Claude Fable 5.1(65.83%),而且其单次测试成本 15.68 美元低于身后所有 Claude 模型。Artificial Analysis 的 Intelligence Index v4.3.2 给 Argon 打出 53 分,明显高于 Gemini 3.8 Flash 的 41 分。不过谷歌尚未公布详细基准对比表,模型也还无法被独立第三方验证,真正的横向对比还有待观察。
不只是一个模型:谷歌的”AI 月”
Argon 的发布是谷歌 9 月密集 AI 动作的收官之作:同月还推出了推理与编码性能更强的 Gemini 3.8 Flash / 3.8 Flash Cyber、面向日常对话的 Gemini 3.8 Live 音频模型和无延迟多步推理的 3.8 Live Extended Thinking、支持自定义音色的 Flash TTS 语音模型、全球上线的音乐生成模型 Lyria 3.5,以及与 NASA 喷气推进实验室合作的甲烷泄漏追踪模型 MAPL-EMIT。
在 7 月的财报电话会上,谷歌 CEO Sundar Pichai 曾明确表示,下一代模型需要”大得多的基础模型”,并点名编程和智能体编程是谷歌必须补齐的短板。Argon 正是这一方向的兑现。
影响与展望
对网络安全行业而言,Argon 的限定发布标志着一场”时间竞赛”的开始:防御方率先获得顶级 AI 漏洞挖掘能力,意味着从漏洞被发现到被修复的窗口正在被压缩。谁先拥有这类能力,谁就掌握了主动权。
对 AI 行业,这次发布也提供了一个新的发布范式样本:当模型能力越过某个危险阈值,”先给防御者、再给公众”的分层发布可能成为前沿实验室的标准动作。这对期待第一时间体验 Gemini 4 的开发者来说是个坏消息,但对整个生态的安全而言,未必是坏事。
接下来值得观察的是谷歌何时放开更广泛的访问,以及对手 Anthropic 和 OpenAI 是否跟进类似的限定发布策略。AI 安全能力的军备竞赛,已经从实验室跑进了真实攻防一线。