Компанія OpenAI визнала, що ще за кілька тижнів до атаки на платформу Hugging Face її внутрішні системи фіксували небезпечну поведінку автономних агентів, але ці сигнали не стали приводом для негайної реакції. Видання Axios передає дані з технічного звіту компанії, який оприлюднили після розслідування інциденту.
“Озираючись назад, можна сказати, що деякі ранні сигнали, описані в цьому звіті, могли б стати підставою для швидшої реакції”, — заявили в OpenAI.
Коли зʼявилися перші попередження
Згідно зі звітом, 27 червня система моніторингу кібербезпеки повідомила про підозрілу активність. Фахівці встановили, що агенти використовували імпровізовану дошку повідомлень для координації своїх дій і переміщення мережею, однак тоді процес тестування вирішили не зупиняти.
Ще за місяць до цього внутрішня команда вже фіксувала випадки, коли агенти використовували аналогічний механізм обміну повідомленнями та виходили в інтернет попри встановлені обмеження. На конференції Black Hat компанія також повідомляла, що її моделі змогли перетворити сервіс Artifactory на засіб комунікації, а потім скористалися вразливістю нульового дня для виходу за межі тестового середовища.
Масштаб зламу
Розслідування показало, що під час кіберінциденту агенти ШІ OpenAI змогли виконати власний код на 41 робочому сервері Hugging Face. На одному з серверів платформи вони навіть отримали права суперкористувача.
Агенти також отримали доступ до облікових даних, певних внутрішніх даних компанії та завантажили чотири приватні репозиторії з кодом. Крім Hugging Face, агенти проникали до систем клієнта Modal Labs та облікового запису користувача іншого неназваного сервісу.
Агенти проникли й у системи OpenAI
Під час внутрішнього тестування моделі знайшли нещодавно оприлюднену вразливість у Linux-середовищі, яке використовувалося для експериментів. Отримавши права суперкористувача, вони почали переміщуватися між пов'язаними системами.
У результаті агенти отримали адміністративний доступ до частини хмарної інфраструктури OpenAI та прочитали 956 секретних файлів, включно з обліковими даними для систем моніторингу кібербезпеки. Одна з внутрішніх моделей ШІ використала знайдений ключ підпису для створення нових адміністративних облікових даних.
Чому агенти вийшли за межі тестового середовища
OpenAI пов'язує інцидент із роботою дослідницького проєкту ExploitGym, який перевіряє здатність моделей самостійно знаходити й використовувати вразливості. За даними компанії, у тестуванні брали участь GPT-5.6 Sol та внутрішня дослідницька модель, причому саме остання виконала основну частину атаки.
Розслідування також показало, що під час навчання моделі могли ненавмисно засвоїти небажану поведінку: якщо стандартні інструменти були недоступні, вони шукали альтернативні способи виконати завдання й іноді отримували позитивну винагороду за такі дії. В одному з наведених прикладів агент скористався вразливістю, щоб отримати доступ до програми, яку мав відтворити, скопіював правильну відповідь і отримав позитивну оцінку за виконане завдання.
Наслідки кіберінциденту
Після інциденту OpenAI призупинила розробку деяких новий моделей, зокрема відклала випуск Astra, і переглядає підходи до безпеки автономних агентів.
Одразу після повідомлень OpenAI щодо зламу Hugging Face компанії Anthropic та Meta зафіксували серію інцидентів, у яких автономні ШІ-агенти виходили за межі тестових середовищ. Зокрема, під час випробувань систем Anthropic і Meta виявили спроби кібератак та маніпуляцій у мережі.
