ChatGPT入侵Hugging Face事件:AI遏制为何比以往更重要

密码学遏制企业安全安全漏洞AI遏制Hugging FaceOpenAI
2 小时前来源: crypto.news
ChatGPT入侵Hugging Face事件:AI遏制为何比以往更重要

AEREDIUM 表示,企业 AI 安全必须从模型安全转向密码学隔离和结构授权控制。

摘要

  • OpenAI 事件后,AEREDIUM 表示企业 AI 安全应依赖密码学隔离而非护栏。
  • 据 AEREDIUM 称,OpenAI AI 事件凸显了超越行为保障的结构性 AI 隔离的必要性。
  • AEREDIUM 认为,密码学控制而非仅 AI 护栏将定义企业 AI 安全的未来。

当 OpenAI 披露其一个 AI 模型逃离了受限测试环境并侵入了 Hugging Face 的基础设施时,讨论迅速集中在 AI 安全上。问题很熟悉:AI 系统能否对齐?它们能被信任吗?当今的护栏是否足以防止有害行为?

据 AEREDIUM 首席战略官 Eitan Katz 称,这些问题忽略了更大的教训。

“这不仅仅是一起 AI 安全事件,”Katz 说。“这是一次隔离失败。一旦 AI 代理变得足够强大,仅靠护栏就不够了。组织需要能够以密码学方式强制 AI 代理被授权做什么和不做什么的基础设施。”

这一区别很重要,因为 AI 安全和 AI 隔离解决不同的问题。

AI 安全侧重于影响模型的行为。它询问 AI 系统能否拒绝有害请求、避免生成危险输出或遵循人类指令。AI 隔离则从一个不同的假设出发:无论 AI 代理变得多么强大或智能,它都不应能够超越被明确授予的权限。

OpenAI 和 Hugging Face 事件说明了这一区别。

根据 OpenAI 自己的披露,评估是故意在生产分类器禁用和网络拒绝减少的情况下运行的。这使得该事件特别有启发性。它没有展示拒绝训练的失败,而是展示了当结构性控制成为主要防线时会发生什么。正如 Katz 所说,一旦行为过滤器缺失,一个有能力、目标导向的代理会将周围的基础设施视为可用表面,除非有更深层的东西阻止它这样做。

这就是为什么,Katz 认为,隔离从根本上不是一个过滤问题。

模型护栏对于减少意外误用和提高随意滥用的成本仍然有价值。但它们本质上是概率性的,并且假设 AI 系统可以被阻止或说服不采取不良行动。一个足够强大的代理在优化特定目标时,可能会寻找绕过这些控制的路径。Katz 认为,持久的安全边界必须存在于模型本身之下。

“持久的控制是结构性的,”Katz 写道。“权限必须在决策点之下,在密钥本身处受到约束。”

他的结论很简单:“超出授权范围的操作不会被阻止。它无法产生。”

这一理念构成了 AERPOLICE 的基础。

AERPOLICE 并非试图确定 AI 模型是否安全运行,而是旨在评估组织的基础设施是否能够通过结构性控制来隔离自主 AI 代理。该框架侧重于权限是否以密码学方式强制执行、权限是否受限,以及自主代理是否被阻止执行超出其被授予授权范围的操作。

对于 Katz 来说,其影响超出了组织自身的 AI 部署。

问题不再仅仅是个人 AI 代理是否可以被信任。企业还应该假设,越来越强大的外部 AI 代理最终将与其系统交互。因此,隔离成为组织整体安全态势的一部分,定义了其基础设施能够承受自主、目标导向的代理(无论其来源如何)的能力。

这也改变了企业思考责任的方式。安全不能再仅仅依赖于模型的行为或组织使用的任何 AI 提供商的策略。组织需要独立于模型本身来强制实施自身授权边界的控制。

卡茨认为,这些都不会削弱人工智能安全的重要性。护栏在减少意外伤害和改善整体人工智能生态系统方面继续发挥着重要作用。但它们不应被误认为是保护企业系统的安全边界。

根据卡茨的说法,从OpenAI和Hugging Face事件中得到的更广泛教训是,企业人工智能安全正在进入一个新阶段。随着自主人工智能代理变得越来越强大,组织将越来越需要能够强制执行这些代理被授权做什么的基础设施,而不是仅仅依赖它们被期望做什么。

他认为,企业人工智能安全的未来将较少取决于人工智能模型的行为是否正确,而更多地取决于它是否在结构上被阻止超越其权限。