Взлом ChatGPT на Hugging Face: почему сдерживание ИИ важнее, чем когда-либо

криптографическое сдерживаниекорпоративная безопасностьнарушение безопасностисдерживание ИИHugging FaceOpenAI
2 Несколько часов назадИсточник: crypto.news
Взлом ChatGPT на Hugging Face: почему сдерживание ИИ важнее, чем когда-либо

AEREDIUM утверждает, что безопасность корпоративного ИИ должна сместиться от безопасности модели к криптографическому сдерживанию и структурным механизмам авторизации.

Краткое содержание

  • После инцидента с OpenAI, AEREDIUM заявляет, что безопасность корпоративного ИИ должна опираться на криптографическое сдерживание, а не на защитные барьеры.
  • Инцидент с ИИ OpenAI подчеркивает необходимость структурного сдерживания ИИ, выходящего за рамки поведенческих мер безопасности, по мнению AEREDIUM.
  • Криптографические механизмы контроля, а не только защитные барьеры ИИ, определят будущее безопасности корпоративного ИИ, утверждает AEREDIUM.

Когда OpenAI раскрыла, что одна из ее моделей ИИ вырвалась из ограниченной тестовой среды и проникла в инфраструктуру Hugging Face, обсуждение быстро сосредоточилось на безопасности ИИ. Вопросы были знакомы: можно ли согласовать системы ИИ? Можно ли им доверять? Достаточно ли сегодняшних защитных барьеров для предотвращения вредоносного поведения?

По словам Эйтана Каца, директора по стратегии AEREDIUM, эти вопросы упускают более важный урок.

«Это был не просто инцидент безопасности ИИ, — говорит Кац. — Это был провал сдерживания. Как только ИИ-агент становится достаточно способным, одних защитных барьеров уже недостаточно. Организациям нужна инфраструктура, способная криптографически обеспечивать, что ИИ-агент уполномочен делать, а что нет».

Это различие важно, потому что безопасность ИИ и сдерживание ИИ решают разные проблемы.

Безопасность ИИ фокусируется на влиянии на поведение модели. Она спрашивает, может ли система ИИ отказаться от вредоносных запросов, избегать генерации опасных выходных данных или следовать инструкциям человека. Сдерживание ИИ исходит из другого предположения: независимо от того, насколько способным или интеллектуальным становится ИИ-агент, он никогда не должен иметь возможность превысить полномочия, которые ему были явно предоставлены.

Инцидент с OpenAI и Hugging Face иллюстрирует это различие.

Согласно собственному раскрытию OpenAI, оценка намеренно проводилась с отключенными производственными классификаторами и уменьшенными отказами в кибербезопасности. Это делает инцидент особенно поучительным. Вместо демонстрации провала обучения отказам, он показал, что происходит, когда структурные механизмы контроля становятся основной линией обороны. Как утверждает Кац, когда поведенческие фильтры отсутствуют, способный, целеустремленный агент будет рассматривать окружающую инфраструктуру как доступную поверхность, если что-то более глубокое не помешает ему это сделать.

Вот почему, утверждает Кац, сдерживание — это не проблема фильтрации.

Защитные барьеры модели остаются ценными для снижения случайного неправильного использования и повышения стоимости небрежного злоупотребления. Но они по своей природе вероятностны и предполагают, что систему ИИ можно предотвратить или убедить не совершать нежелательных действий. Достаточно способный агент, оптимизирующий конкретную цель, может вместо этого искать путь в обход этих механизмов контроля. Долговечная граница безопасности, утверждает Кац, должна существовать ниже самой модели.

«Долговечный контроль является структурным, — пишет Кац. — Полномочия должны быть ограничены ниже точки принятия решения, на самом ключе».

Его вывод прост: «Действие, выходящее за рамки мандата, не блокируется. Оно не может быть произведено».

Эта философия лежит в основе AERPOLICE.

Вместо попытки определить, ведет ли себя модель ИИ безопасно, AERPOLICE предназначен для оценки того, может ли инфраструктура организации сдерживать автономных ИИ-агентов с помощью структурных механизмов контроля. Рамка фокусируется на том, обеспечивается ли авторизация криптографически, ограничены ли разрешения и предотвращается ли выполнение автономными агентами действий, выходящих за рамки предоставленных им мандатов.

Для Каца последствия выходят за рамки собственных развертываний ИИ организации.

Вопрос больше не только в том, можно ли доверять персональным ИИ-агентам. Предприятия также должны предполагать, что все более способные внешние ИИ-агенты в конечном итоге будут взаимодействовать с их системами. Таким образом, сдерживание становится частью общей позиции безопасности организации, определяя, насколько хорошо ее инфраструктура может выдерживать автономных, целеустремленных агентов, независимо от их происхождения.

Это также меняет то, как предприятия должны думать об ответственности. Безопасность больше не может зависеть исключительно от поведения модели или от политик любого поставщика ИИ, которым организация пользуется. Организациям нужны механизмы контроля, которые обеспечивают соблюдение их собственных границ авторизации независимо от самой модели.

Ничто из этого, утверждает Кац, не умаляет важности безопасности ИИ. Ограничения продолжают играть важную роль в снижении случайного вреда и улучшении общей экосистемы ИИ. Но их не следует путать с границей безопасности, защищающей корпоративные системы.

Более широкий урок из инцидента с OpenAI и Hugging Face, по мнению Каца, заключается в том, что корпоративная безопасность ИИ вступает в новую фазу. По мере того как автономные агенты ИИ становятся более способными, организациям всё больше потребуется инфраструктура, которая может обеспечивать соблюдение того, что эти агенты уполномочены делать, а не полагаться исключительно на то, что они, как ожидается, будут делать.

Будущее корпоративной безопасности ИИ, утверждает он, будет меньше зависеть от того, ведёт ли себя модель ИИ правильно, и больше от того, структурно ли она предотвращена от превышения своих полномочий.