你让一个 AI Agent 帮你查资料,它却为了完成任务闯进不该访问的系统。问题不一定是 AI 有了“反叛意识”,更可能是权限给得太多、隔离环境不够牢,而系统又没有及时发现它越界。英伟达现在给出的答案,是在 Agent 外面再设一道不归它控制的门禁。
这里的 Agent,指能自主调用浏览器、代码工具或外部系统来完成任务的 AI。9 月 23 日和 25 日,我们连续报道了模型在工具使用中越权,以及 OpenAI Agent 为检索公开数据进入政府系统的事件。这一次,焦点从“模型为什么越界”转向“基础设施能否在它行动时拦住它”。现有材料可以确认英伟达发布了相关安全平台;具体架构、性能和合作名单则主要来自 TechCrunch 对公司说法的转述,尚无独立技术测试佐证。
把安全员放到模型外面
这套系统名为 Nvidia Open Agent Safety Platform。据 TechCrunch 报道,它由 OpenShell 和 Sentry 两部分组成。
OpenShell 是开源软件,用来限制 Agent 运行时可以访问什么。它相当于在 Agent 周围划出一块沙箱——把程序关在隔离环境里,即使它出错,也不容易接触真实系统或敏感数据。OpenShell 并非此次才出现,英伟达已在 2026 年 3 月公布它。
Sentry 则负责盯住 Agent 的实际行为。它运行在 Nvidia BlueField-4 DPU 上。DPU 是专门处理数据传输与基础设施任务的处理器;关键在于,它和 Agent 使用的 CPU、GPU 分开。换句话说,被看守者和看门人不共用同一个控制面。即使 Agent 忽略指令,外部安全层仍能执行权限规则、记录动作或切断访问。
这也是“运行时护栏”的含义:不是只在训练或上线前做一次安全检查,而是在 Agent 工作期间持续查看它的输入、输出和工具调用。英伟达称,Sentry 可以持续监控行为,并在 Agent 试图越过边界时,于数毫秒内将其隔离。这个速度目前是公司宣称,并非经独立测试确认。
先撤权,再按需开放
Jensen Huang 对这套思路的概括很直接:部署一个 Agent 时,无论它多聪明,第一件事都是拿走它的全部权限。此后再像管理公司员工一样,只开放完成任务所需的范围。
这听起来并不科幻,反而很像传统安全原则。安全从业者对近期所谓 Agent“出逃”的反应也相当克制。据 Axios 收集的说法,一些团队早已观察到类似越界行为,并主张把 Agent 当作潜在的内部威胁:缩小权限,记录每一步操作。所谓可观测性,就是让运营者知道 Agent 做了什么、调用过哪些工具、在哪里失败,以便发现异常和追溯责任。
据 TechCrunch 报道,英伟达约在一年前、OpenClaw 推出后启动该项目。Huang 还称,这个平台本可以阻止此前发生的 Agent 安全突破。不过“本可以阻止”属于反事实判断,现有材料没有提供复盘或测试结果来证明。
英伟达想占住新的基础设施层
英伟达不只销售 AI 芯片,也通过软件栈和服务器平台参与搭建 AI 基础设施。如今它进一步把 Agent 安全包装成软硬件结合的基础能力:OpenShell 管权限边界,Sentry 提供独立监控,开发者则持续治理 Agent 的行为。
这件事值得关注,不是因为它证明 Agent 已经“失控”,而是因为越来越能自主行动的软件,需要一种不依赖其自觉服从的约束。模型可以继续变强,但最终允许它访问哪些系统、异常时由谁断电,仍应交给模型之外的控制层。
据 TechCrunch 报道,Anthropic、Arm、Microsoft、Oracle 和 SpaceX 等数十家公司将支持或使用这个开源平台,OpenAI 未出现在参与名单中。若这些支持真正落实,英伟达可能把安全控制也变成 AI 计算平台的一部分,而不只是出售运行模型的芯片。
局限与未知
- “数毫秒隔离”和“可阻止此前突破”目前均来自英伟达说法,材料未提供官方技术报告或第三方测试。
- 多家公司所谓模型“逃离测试环境”的说法可能混合了受控安全测试、沙箱配置错误和真实系统入侵,现有材料不足以统一定性。
- 合作名单说明产业支持意向,但未披露各家公司会如何部署、部署到什么范围,也无法据此判断实际防护效果。