Nvidia 围绕开放模型建立了人工智能安全联盟。 OpenAI、Google 和 Anthropic 均未上榜。
Nvidia 的开放安全 AI 联盟于 2026 年 7 月 27 日成立,共有 37 个合作伙伴,但没有 OpenAI、Google 或 Anthropic。成员们贡献了什么,以及还缺少什么。
英伟达宣布了什么
2026 年 7 月 27 日星期一, 英伟达 宣布了 开放安全人工智能联盟,一个联盟,旨在构建和分发用于防御软件和人工智能代理的开放工具。对于行业联盟来说,范围很窄,而且异常具体:安全团队应该能够检查他们所防御的模型,对其进行调整,并在他们控制的硬件上运行它们。

计算成员数量比应有的困难。 Nvidia 的公告以“包括”一词开头的句子命名其合作伙伴,但从未给出总数,这就是为什么报道范围从 Tom's Hardware 的“超过 30 个”到 AI Weekly 的 44 个。大多数网点选择的数字是 37,这在发布当天是正确的。此后,名单不断扩大。计算上面复制的 Nvidia 发布的新闻资料包图形中的徽标,得出 包括 Nvidia 在内的 52 个组织,于 2026 年 7 月 29 日查看。周一不存在的名字包括 Box、Crusoe、F5、Fortinet、G42、GitHub、Mistral、Nokia、Perplexity、Uber、Upwind、vLLM 和 Zscaler。
成员倾向于基础设施和安全供应商,而不是模型实验室:Microsoft、IBM、Red Hat、Cisco、Cloudflare、CrowdStrike、Palo Alto Networks、Fortinet、Zscaler、Elastic、Palantir、Databricks、Dell、HPE、NetApp、Siemens、SAP、Salesforce、ServiceNow。 Linux 基金会是其成员,Nvidia 表示该联盟建立在基金会的 Akrites 计划和 OpenSSF 工作的基础上。它没有说基金会托管或管理它,也没有其他人声称这一点。
引起争论的事件
该联盟的存在是因为三周前发生的一起事件。 2026 年 7 月,两个正在内部评估的 OpenAI 模型逃出了沙箱并突破了 抱脸的生产系统,我们介绍过的故事 OpenAI 披露自主违规事件。变成联盟的部分并不是闯入。这就是抱脸试图调查此事时发生的事情。
取证分析意味着向模型提供数千条真实的攻击命令、漏洞利用有效负载以及命令和控制工件。商业API拒绝了。 Hugging Face 自己的披露清楚地表明:这些请求“被提供商的安全护栏阻止”,无法区分事件响应者和攻击者。 亚辛杰尼特Hugging Face 机器学习负责人告诉 CNBC,护栏“无法确定我们是在试图防御还是在攻击”。该团队尝试过前沿模型,包括 Anthropic 的《神鬼寓言 5》。托管路线也更慢且更昂贵。
有效的是 GLM 5.2,来自中国开发商的开放权重模型 爱,在 Hugging Face 自己的基础设施上运行。它在几小时而不是几天内根据 17,000 多个记录事件重建了时间线,并且没有攻击者数据或凭据离开建筑物。 Hugging Face 对这种不对称性的总结是任何人对这一事件所写的最尖锐的一句话:“攻击者不受任何使用政策的约束,而我们自己的取证工作则受到我们第一次尝试的托管模型的护栏的阻碍。”
英伟达未签署的声明就是以这句话为基础的。报告称:“当防御者无法在自己的基础设施上检查、调整和运行先进的人工智能时,他们的响应能力就在速度最重要的时刻受到限制。”
会员实际运送了什么
对于此类发布来说,不同寻常的是,一些成员带着代码而不是意图声明出现。

英伟达的贡献是 诺阿,在 GitHub 上发布为 NVIDIA-NeMo/labs-OO-Agents 在 Apache 2.0 下。甚至 Nvidia 自己的材料中的名称也不一致,这些材料将其扩展为“NVIDIA-labs OO Agents”和“Object-Oriented Agents”。其背后的想法很简单:代理是一个普通的 Python 类,其中字段保存状态,方法公开功能,文档字符串充当提示。主体为省略号的方法在运行时由 LLM 循环填充。其他一切都保持确定性 Python,这使得代理行为可测试和可审计,而不是提示文本墙。
上下文中的基准数字
Nvidia 报告 NOOA 评分 CyberGym L1 上的 86.8% 使用 GPT-5.5 进行漏洞发现基准测试,并阻止网络访问。阅读 Nvidia 论文中的表格而不是标题。 Microsoft 的 MDASHv2 在同一基准测试中得分为 95.6%,而运行 Opus 4.6 的 Crystalline 得分为 89.6%。两者都已关闭。 NOOA的号称是最强 开源 该列表中的代理,而不是最强的代理,Nvidia 发布的数字使区别变得明显。
该存储库对于它不做的事情也直言不讳,令人耳目一新。它的自述文件警告说,LLM 生成的代码“可能会采取危险或不需要的操作”,并且 NOOA 的语法树检查和模块拒绝列表是“纵深防御护栏,而不是遏制边界”。 Python 上的静态检查器不可能是这样的:open() 到达文件系统,importlib 从路径加载模块,反射到达剩下的任何内容。真正的遏制是操作系统级别的隔离,文档也是这么说的。
其余的开幕贡献:
- 微软: MDASH,一种多模型代理扫描工具,运行专门的代理来发现、辩论和证明可利用的错误。
- 抱脸: Safetensors 是一种权重存储格式,可保证加载时不会执行远程代码,已捐赠给 PyTorch 基金会。
- IBM 和红帽: Lightwell,通过数字签名补丁扩展开源供应链安全性。
- 慧与: 继续为 SPIFFE/SPIRE 做出贡献,这是零信任身份标准,以加密方式验证哪些代理和服务可以与哪些内容进行通信。请注意,SPIFFE/SPIRE 是现有的 CNCF 项目,而不是新的捐赠项目。
- SpaceX人工智能: Grok Build 终端编码代理,开源,以及发布 Grok 模型系列权重的既定计划。重量是一种承诺,而不是一种释放。
谁不在房间里
OpenAI、Anthropic、Google 和 Meta 无论是在发布时还是今天,都不会出现在名册上。他们之间建立了封闭的边界模型,其护栏将 Hugging Face 排除在其自身事件之外,这使得他们没有加入围绕这一确切投诉组织的联盟,成为有关此次发布的最受关注的事实。

他们都没有解释过。当 CSO Online 询问是否加入时,OpenAI 没有回应。 Anthropic 对联盟本身只字不提,尽管二级媒体一直在重复声称该联盟因公开重量风险而拒绝的说法。这一说法可以追溯到达里奥·阿莫迪关于测试开放模型的一般性评论,而不是任何有关该联盟的声明,并且不应将其作为事实重复。从某个方面来说,这个时机确实很奇怪:OpenAI、谷歌和 Meta 于 7 月 24 日签署了一封公开信,敦促华盛顿不要限制开放权重模型,三天后,他们就不再参与围绕这一论点而聚集的名单。
缺席并不构成拒绝的证据。英伟达的名单显然并不详尽,没有人透露谁收到了邀请。更尖锐的遗漏是另一回事。 Z.ai 也不是会员。 其模型实际上进行了英伟达声明中作为其创始示例的辩护的中国实验室并没有出现在新闻资料中,Zhipu 这个名字也没有出现。一个以“开放重量模型拯救了我们”为起源的联盟尚未与制造该联盟的公司签约。
没有章程,没有维护者,没有承诺
以下是联盟尚未发布的内容:章程、管理机构、工作流、指定维护者、发布流程、共享存储库或任何关于成员资格要求成员做什么的声明。截至2026年7月29日,独立联盟网站仍在建设中。 Nvidia 页面上唯一具体的机制是邀请其他人表达加入兴趣的链接。

这种差距很重要,因为它使名单变得难以阅读。到目前为止,还没有发布任何内容来区分指派工程师分担工作的公司和同意将其徽标放置在图形中的公司。 52 个徽标和 6 个命名贡献的比例值得注意。 Moor Insights & Strategy 在发布当天就有 37 个合作伙伴,他们用五个词表达了怀疑:“联盟发布的内容比发布的内容还要多。”
看什么
有四件事将表明这是工程工作还是定位练习,并且所有四件事都可以在几个月内进行检查。是否存在由来自多个成员公司的维护者共同管理的存储库? SpaceXAI 是否会公布其承诺的 Grok 权重? Safetensors 是否已完成向 PyTorch 基金会的迁移?有没有人针对 CyberGym 的差距提供一个可行的答案,即最好的开放式代理仍然落后最好的封闭式代理 9 个百分点?
更深层次的问题超出了联盟的能力范围。 Hugging Face 的问题并不是缺少开放式工具。实时入侵中的防御者无法将攻击者的有效负载粘贴到商业模型中而不被拒绝,解决这个问题的方法是由四家非会员公司提供的带有身份验证和审计日志记录的防御者模式策略。在他们中的一个构建它之前,“运行你自己的模型”仍然是唯一可靠的答案,每个读过 Hugging Face 事后分析的安全团队现在都知道要对一个模型进行审查并等待他们需要它。 Nvidia 的完整公告是 在其博客上。