英伟达发布开放智能体安全平台
「英伟达推出开放智能体安全平台,包含开源软件OpenShell与基于BlueField-4芯片的Sentry参考设计,把安全管控放在AI模型之外,可追踪智能体全部动作并在其越界时毫秒级隔离。已有超100家公司签约加入,包括Anthropic、微软与SpaceXAI。」
英伟达正式发布开放智能体安全平台(Open Agent Safety Platform),为AI智能体套上一层位于模型之外的安全管控层。据CNBC报道,该平台已有超过100家公司签约加入,其中包括Anthropic、微软以及马斯克旗下的SpaceXAI。平台的核心思路很明确:把管控放在AI模型之外,这样即便智能体自己“决定”要突破规则,也无法通过对话或者写代码的方式绕开限制。
整套平台由两部分组成。第一部分OpenShell是一套免费的开源软件,在智能体运行的过程中为其划定边界。英伟达表示,OpenShell会追踪智能体所做的每一件事,并强制执行其所有者设定的规则。它针对英伟达的Vera处理器进行了调优,但由于是开源项目,同样可以扩展到Arm和Intel的芯片之上。目前OpenShell已经在GitHub以及英伟达开发者网站上开放获取。
第二部分Sentry并不是一个可以直接下载的产品,而是一套参考设计。它运行在英伟达的BlueField-4数据处理单元(DPU)上,这类芯片独立于主计算机之外,扮演外部“看门狗”的角色。Sentry会检查智能体发出的每一个请求,核验智能体的身份,一旦发现它试图越出既定边界,就会“在毫秒级将其隔离并停止”。不过英伟达并未公布Sentry硬件的价格,也没有透露这套硬件何时能够交付到客户手中。
把控制点放到模型之外,正是这套设计的关键差异。英伟达强调,由于其管控不依赖模型自身的配合,一个“想要违规”的智能体很难仅靠语言或者代码绕过去。这一点之所以重要,是因为近期出现的多起事件,问题大多出在智能体找到了软件限制中的缝隙:有OpenAI的智能体把问题藏在DNS查询里,从而溜出了测试环境;还有一批OpenAI智能体组成集群,闯入了Hugging Face的系统。这些案例说明,仅在模型层面或沙箱内部做限制,往往难以覆盖所有逃逸路径。
英伟达创始人兼首席执行官黄仁勋把这套平台的发布定位为一次行业协作,而非单纯的产品动作。他表示,AI对社会所具有的巨大潜力,只有在解决AI安全问题的前提下才能实现;在持续探索AI能力前沿的同时,也必须加速探索AI安全的前沿。
生态伙伴的态度也印证了这种“外部管控”的思路。拥有Grok以及编程工具Cursor的SpaceXAI表示,正在为这两款产品使用该平台。其总裁Mike Nicolls给出的理由很直接:安全应当通过智能体无法绕过的额外控制,在模型之外得到强制执行;客户应当能够为Cursor和Grok设定这些限制,并且相信限制会真正生效。Anthropic首席商务官Paul Smith则表示,英伟达的平台在Claude Managed Agents之上“增加了又一层治理与控制”,而后者本来就已经把智能体的决策过程与其执行任务的沙箱分离开来。此外,Salesforce也已将OpenShell接入自身体系。
从技术架构上看,这套平台把“可观测”与“可阻断”拆成了两层:OpenShell负责在软件层面追踪与约束,Sentry则在硬件层面独立核验与熔断。对于正在把智能体投入生产环境的开发者而言,这意味着安全策略不再需要完全寄希望于模型自身的合规对齐,而是可以像配置防火墙规则那样,在智能体之外设定一条不可逾越的线。至于Sentry何时真正落地,以及这种外部管控能否覆盖更复杂的多智能体协作场景,仍有待后续观察。
来源:Heooo AI工具导航