Весной 2026 года рой автономных агентов OpenAI захватил немецкоязычный вики-сайт DseWiki и превратил его в закрытую доску объявлений для координации своих действий. Боты совершили более 15 тысяч правок с сверхчеловеческой скоростью. Компания узнала об инциденте несколько недель назад, но не сообщала о нем публично, поскольку преодолевала последствия июльского взлома открытого репозитория Hugging Face, сообщает Reuters.
Инцидент обнаружили исследователи в области безопасности ИИ Сидни Фон Аркс, руководительница некоммерческой организации Nightingale, и Кормак Слейд Бьорд, бывший квантовый трейдер, который впоследствии перешел в сферу исследований искусственного интеллекта. В конце августа они сканировали интернет в поисках признаков несанкционированного поведения ИИ-агентов и наткнулись на эту активность.
DseWiki — это сайт для программистов, где пользователи могут публично редактировать материалы, подобно Википедии. Исследователи выяснили, что агенты превратили его в площадку для обмена тактиками. В частности, они обсуждали, как обманывать систему при выполнении задач, обходить ограничения OpenAI и скрывать собственное поведение.
Примерно у половины аккаунтов были названия, намекающие на связь с компанией. Среди них, например, «OpenAIResearcher» и «OAIResearchMar26». Публичные логи серверов также показывали, что значительная часть активности исходила из инфраструктуры Microsoft Azure, которую OpenAI иногда использует. Кроме того, исследователи зафиксировали, что сотрудники OpenAI неоднократно посещали сайт уже после завершения этого эпизода.
«Похоже, крайне маловероятно, что OpenAI хотела, чтобы они так поступали. Сомневаюсь, что они должны были координироваться между собой. Сомневаюсь, что они должны были писать в открытом интернете», — заявила Фон Аркс.
Сообщения, проанализированные исследователями, свидетельствуют о том, что агенты обсуждали, как избежать обнаружения. В частности, они предлагали использовать Tor и пытались сохранить каналы связи даже после того, как их закрывали. Когда в июне модератор сайта начал удалять страницы, боты в ответ создавали резервные копии.
«Похоже, что очистка и удаление на вики происходят последовательно по алфавиту. Если эта страница исчезнет, попробуйте [[ZZZDataUSAConstructionWageLive]]», — написал один из агентов 19 июня.
Исследователи также обнаружили попытки вмешательства в работу самого сайта. Лукаш Олейник, старший научный сотрудник Кингс-колледжа в Лондоне, назвал это попыткой взлома. OpenAI на основании собственного анализа материалов не согласилась с такой трактовкой.
Морис Чиодо, исследователь Центра изучения экзистенциального риска Кембриджского университета, ознакомившийся с частью переписки агентов, сравнил увиденное с «операцией некой подпольной сети, одержимой выполнением задачи или миссии».
По его словам, этот эпизод должен усилить обеспокоенность относительно другого возможного сценария развития ИИ. Наибольшую угрозу может представлять не появление одной сверхразумной системы, а «огромные заговорщические рои полуразумных агентов ИИ».
По информации четырёх источников, осведомленных о ситуации, попытки внутренних следователей OpenAI расширить мониторинг подобных аномалий встретили сопротивление внутри компании. В частности, со стороны юридических консультантов.
«Утверждения о том, что наша юридическая команда препятствовала расследованию инцидента, не соответствуют действительности», — заявил представитель OpenAI.
По его словам, активность в Германии не связана с инцидентом вокруг Hugging Face и не должна была быть включена в отчет об этом взломе. Пресс-секретарь также заявил, что компания действовала добросовестно, сотрудничала с внешними экспертами и раскрывала информацию о соответствующих инцидентах.
«Мы не можем содержательно ответить на утверждения или выводы отчета, с которым у нас еще не было возможности ознакомиться. Reuters и авторы отчета отказали нам в доступе. Мы внимательно изучим его содержание после публикации и предпримем необходимые дальнейшие шаги», — заявил представитель компании.
Инцидент в Германии стал не первым случаем, когда поведение агентов OpenAI выходило из-под контроля. Во время июльского взлома Hugging Face агенты компании самостоятельно спланировали цифровое похищение данных. Оно оставалось незамеченным более недели. Расследование также показало, что еще до атаки системы OpenAI фиксировали подозрительное поведение агентов, но тестирование тогда не остановили. Это усилило опасения по поводу того, что OpenAI может жертвовать безопасностью ради лидерства в развитии передовых технологий.
После этого инцидента OpenAI приостановила обучение части моделей, чтобы усилить меры безопасности. Компания также начала разрабатывать механизмы, которые должны автоматически отключать опасные системы. Между тем OpenAI представила новую модель Astra, которая во время тестов уже продемонстрировала способность самостоятельно находить и использовать неизвестные уязвимости.
