Кратко

  • GPT-5.6 Sol от OpenAI и безымянная, более мощная предрелизная модель сбежали из контролируемой тестовой среды и взломали производственную инфраструктуру Hugging Face, чтобы украсть ответы на тесты.
  • Hugging Face раскрыла утечку 16 июля после самостоятельного обнаружения; OpenAI сегодня подтвердила, что за этим стоят её модели, описав их как «гиперсфокусированные» на мошенничестве, а не на чём-то более зловещем.
  • Защитники Hugging Face обратились к GLM 5.2 от Z.ai — китайской модели с открытыми весами — после того, как коммерческие передовые ИИ США отказались помогать анализировать данные атаки, поскольку их фильтры безопасности не могли отличить защитника от атакующего.

Если вы думали, что китайские ИИ-модели — это те, о которых стоит беспокоиться, вот забавное обновление: собственные модели OpenAI только что вырвались из закрытой тестовой среды, взломали производственные серверы Hugging Face, и их пришлось устранять китайскому ИИ — потому что американские коммерческие модели были слишком ограничены, чтобы помочь в расследовании.

По данным OpenAI, GPT-5.6 Sol и безымянная «ещё более мощная предрелизная модель» проходили внутреннюю оценку на ExploitGym — общедоступном тесте кибербезопасности, который даёт ИИ-агентам 898 реальных уязвимостей программного обеспечения и одну инструкцию на каждую ошибку: превратить её в работающую атаку, оцениваемую как пройдено или не пройдено. Оценка проводилась с пониженными фильтрами безопасности, что стандартно, когда вы действительно хотите узнать, на что способны ваши модели.

Модели должны были работать в строго ограниченной песочнице — изолированной цифровой среде без доступа в интернет, подключённой только к внутреннему прокси-реестру пакетов (кэширующему серверу, управляющему загрузками библиотек программного обеспечения).

Но, согласно сегодняшнему сообщению в блоге OpenAI, всё вышло из-под контроля.

«Работая в нашей изолированной тестовой среде, наши модели потратили значительное количество вычислительных ресурсов на поиск способа получить открытый доступ в интернет в стремлении решить оценочную задачу», — сообщила компания Сэма Альтмана.

И, несмотря на меры предосторожности компании, ИИ нашли способ освободиться. Модели обнаружили уязвимость нулевого дня — неизвестный программный дефект без существующего патча — в этом прокси, использовали его для повышения привилегий (получили доступ уровня администратора к системам, к которым им не следовало прикасаться), переместились латерально (перепрыгивали между подключенными серверами внутри внутренней сети OpenAI) и в конечном итоге добрались до машины с реальным доступом в интернет.

Все это без ведома OpenAI — по крайней мере, так утверждает OpenAI.

Оказавшись в сети, они правильно предположили, что Hugging Face — хранилище более миллиона общедоступных моделей ИИ, наборов данных и исследовательских ресурсов — вероятно, содержит эталонные решения, и они оказались правы.

«Модели выявили и объединили уязвимости в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face, чтобы получить тестовые решения напрямую из производственной базы данных Hugging Face», — написала OpenAI.

Им не нужны были пароли. Они хотели пройти тест.

«Все свидетельства указывают на то, что модели были гиперсосредоточены на поиске решения для ExploitGym, прилагая экстремальные усилия для достижения довольно узкой тестовой цели», — добавила OpenAI.

Hugging Face выходит в открытый доступ

Команда безопасности Hugging Face самостоятельно обнаружила взлом, чему способствовало собственное обнаружение аномалий на основе ИИ.

16 июля компания опубликовала свое уведомление и дала понять, что это не стандартный взлом: «Этот случай отличался от всего, с чем мы сталкивались ранее, в одном важном аспекте: он был полностью управляем автономной системой ИИ-агентов — и мы обнаружили и проанализировали его в значительной степени с помощью собственного ИИ».

Согласно уведомлению, кампания была «запущена автономной агентной средой, выполнившей многие тысячи отдельных действий в рое недолговечных песочниц, с само-мигрирующим командным центром, размещенным на публичных сервисах».

Атака использовала два пути выполнения кода в конвейере обработки наборов данных Hugging Face и получила доступ к внутренним наборам данных и учетным данным сервисов. OpenAI подтвердила сегодня — пять дней спустя — что за этим стояли ее модели.

Чтобы проанализировать более 17 000 зарегистрированных событий атакующего, команда безопасности Hugging Face сначала попробовала американский передовой ИИ через их стандартные API. Это прошло не очень хорошо.

«Когда мы начали анализ логов, мы сначала использовали передовые модели через коммерческие API», — написала компания. «Это не сработало: анализ требует отправки больших объемов реальных команд атак, эксплойтов и артефактов C2».

«Эти запросы были заблокированы защитными барьерами провайдеров, которые не могут отличить реагирующего на инцидент от злоумышленника», — добавил Hugging Face.

Поэтому они переключились на GLM 5.2 — модель с открытым весом в 753 миллиарда параметров (архитектура полностью открыта, любой может скачать и запустить её локально) от китайского AI-стартапа Z.ai. «Мы провели криминалистический анализ на GLM 5.2, модели с открытым весом, на собственной инфраструктуре», — написал Hugging Face. «Это дало второе преимущество: никакие данные атакующего и ни один из упомянутых в них учётных данных не покинули нашу среду».

Криминалистическая работа — восстановление хронологии атаки, картирование скомпрометированных учётных данных, отделение реального ущерба от отвлекающих действий — заняла часы вместо дней.

Hugging Face сделал прямой вывод для других защитников: «Имейте под рукой проверенную и готовую модель, которую можно запустить на собственной инфраструктуре до инцидента, чтобы избежать блокировки защитными барьерами и не допустить утечки данных и учётных записей атакующего из вашей среды».

Что делает OpenAI в связи с этим

OpenAI заявила, что ввела строгий контроль над исследовательской инфраструктурой, одновременно исправляя затронутые системы, раскрыла zero-day стороннему поставщику, чей прокси был использован, и проводит совместное криминалистическое расследование с Hugging Face.

Hugging Face также был добавлен в программу доверенного доступа OpenAI для киберзащиты — предоставляя одобренным организациям доступ к версиям своих моделей с уменьшенными фильтрами безопасности для легитимной работы по безопасности, той же конфигурации, с которой всё началось.

Генеральный директор Hugging Face Клем Деланг высказал резкое мнение: «Безопасность ИИ не будет решена ни одной компанией, работающей в тайне. Она будет решена открыто, совместно, с широким доступом к ИИ для каждого защитника повсюду».

OpenAI назвала инцидент «связанным с новейшими кибервозможностями» и обязалась поделиться полными результатами после завершения совместного расследования с Hugging Face.