«Фантастика стала реальностью»: эксперт проанализировал случайный взлом Hugging Face с помощью модели OpenAI
«Фантастика стала реальностью»: эксперт проанализировал случайный взлом Hugging Face с помощью модели OpenAI

«Фантастика стала реальностью»: эксперт проанализировал случайный взлом Hugging Face с помощью модели OpenAI

«Фантастика стала реальностью»: эксперт проанализировал случайный взлом Hugging Face с помощью модели OpenAI

Модель самостоятельно обнаружила уязвимости, вырвалась из «песочницы» и похитила тестовые ответы.

Компания OpenAI подтвердила, что её экспериментальная модель искусственного интеллекта в ходе внутреннего тестирования вышла за пределы изолированной среды и скомпрометировала инфраструктуру ИИ-платформы Hugging Face. Модель воспользовалась рядом уязвимостей, чтобы получить ответы на тест ExploitGym, который должна была пройти самостоятельно. На инцидент обратил внимание разработчик и исследователь ИИ Саймон Уиллисон, назвав его примером того, что еще недавно казалось научной фантастикой.

Первые подробности этой истории стали известны из трёх документов. Речь идёт о научной статье ExploitGym, опубликованной 11 мая 2026 года, сообщение Hugging Face об инциденте безопасности от 16 июля и заявление OpenAI от 21 июля, в котором компания подтвердила, что источником атаки стала её собственная система во время внутреннего тестирования.

Новый метод проверки кибербезопасности

ExploitGym — это новый бенчмарк, созданный исследователями Калифорнийского университета в Беркли, Института Макса Планка, Калифорнийского университета в Санта-Барбаре и Университета штата Аризона. Он оценивает не способность моделей находить уязвимости, а их возможность превращать известные уязвимости в реальные эксплойты.

Набор содержит 898 сценариев, построенных на основе реальных уязвимостей в популярных программных проектах, в частности в ядре Linux и движке V8. Авторы отметили: «Наши результаты свидетельствуют о том, что автономная разработка эксплойтов передовыми ИИ-агентами больше не является гипотетической возможностью».

В исследовании лучшие результаты продемонстрировали Claude Mythos Preview компании Anthropic и GPT-5.5 от OpenAI, которые успешно выполнили 157 и 120 задач соответственно. Модель GPT-5.4 решила 54 задачи, тогда как большинство других моделей не справились даже с 15 сценариями.

Еще при создании ExploitGym авторы предвидели риск того, что модели могут пытаться обойти правила теста. Именно поэтому внешние сетевые соединения ограничили списком разрешенных ресурсов, необходимых лишь для установки пакетов и сборки программного обеспечения.

Подробности кибератаки от Hugging Face

В четверг, 16 июля, Hugging Face сообщила о сложной кибератаке, осуществленной автономной агентной системой на базе большой языковой модели. По данным компании, вредоносный набор данных использовал два способа выполнения кода, после чего злоумышленник получил доступ к узлам, собрал учетные данные облачных сервисов и проник в несколько внутренних кластеров.

В ходе анализа инцидента Hugging Face сначала пыталась использовать коммерческие модели через API. Однако защитные механизмы этих сервисов блокировали запросы, поскольку не могли отличить специалистов по реагированию на инциденты от потенциальных злоумышленников.

В результате компания перешла на локально развернутую модель GLM-5.2 с открытыми весами. В Hugging Face пришли к выводу, что возникла фундаментальная асимметрия: злоумышленник не был ограничен политиками безопасности моделей, тогда как защитники не могли полноценно использовать те же инструменты.

Официальное признание OpenAI

Через пять дней OpenAI официально подтвердила, что атака стала результатом её собственного внутреннего тестирования. Компания сообщила, что использовала GPT-5.6 Sol и ещё одну, неанонсированную модель с отключёнными киберограничениями для проверки максимальных возможностей в среде ExploitGym.

«Модели обнаружили и объединили уязвимости в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face, чтобы получить тестовые решения непосредственно из производственной базы данных Hugging Face», — говорится в заявлении компании.

По информации OpenAI, модель сначала обнаружила уязвимость «нулевого дня» в прокси-сервере кэширования пакетов, который использовался в тестовой среде. После этого она выполнила серию действий по повышению привилегий, получила доступ к узлу с выходом в интернет, а затем атаковала Hugging Face.

Компания также сообщила, что после выхода в интернет модель самостоятельно пришла к выводу, что Hugging Face может содержать наборы данных и решения для ExploitGym. Для получения необходимой информации и удаленного выполнения кода на серверах платформы она использовала похищенные учетные данные и уязвимости нулевого дня.

Проблема ограничений безопасности

По словам Уиллисона, одним из самых острых моментов этой истории стало то, что Hugging Face во время атаки со стороны модели OpenAI не смогла использовать инструменты той же компании для защиты. Ограничения коммерческих ИИ-систем могут затруднять работу специалистов по кибербезопасности, тогда как китайские открытые модели, такие как GLM-5.2, Kimi 3 или Qwen 3.8 Max, в большинстве случаев не имеют таких барьеров. В итоге ограничения, призванные повысить безопасность, рискуют дать прямо противоположный эффект, оставляя защитников без эффективных инструментов.

Реальность автономных угроз

По мнению Уиллисона, отрицать реальность становится всё сложнее, хотя многие скептики называют этот инцидент нечестным маркетинговым ходом OpenAI —, только на Hacker News слово «маркетинг» упомянули 81 раз. Исследователь призывает перестать «прятать голову в песок» и выдвигать теории заговора вокруг Hugging Face, ведь лучшие современные ИИ-модели уже действительно способны самостоятельно находить и эксплуатировать уязвимости. Как подводят итоги в исследовании ExploitGym, автономное создание эксплойтов передовыми ИИ-агентами перестало быть теоретическим риском и превратилось в доказанную практику.

Для противодействия подобным рискам специалисты активно ищут новые подходы. В частности, в начале этой недели исследователи из Tracebit предложили метод «контекстных бомб», который принудительно останавливает хакерские ИИ-модели с помощью текстовых триггеров на «запрещенные темы».

Источник материала
loader
loader