Невдовзі після заяви компанії OpenAI щодо призупинення навчання новітніх моделей штучного інтелекту стало відомо, що її агенти ШІ з квітня до кінця червня понад 16 тисяч разів сканували онлайн-ресурс підрозділу ООН з питань торгівлі та розвитку й обходили його систему захисту. Боти використовували агресивні методи отримання інформації, коли стикалися з обмеженнями, повідомляє The Wall Street Journal.
Про активність агентів вперше розповіла інженерка Роуен Говард-Джонс, яка підготувала звіт на основі даних дослідницької компанії Transluce. За її словами, боти, ймовірно, мали завдання шукати загальнодоступну інформацію. Однак коли вони стикалися з перешкодами, то вдавалися до більш агресивних методів: зокрема, обійшли фільтр, який блокував їхні запити, і зрештою використали спосіб доступу, заборонений адміністраторами сайту.
Представниця підрозділу ООН з питань торгівлі та розвитку підтвердила, що організацію поінформували про «активність неконтрольованої моделі ШІ, спрямовану на один із статистичних сайтів». Вона наголосила, що «потенційна загроза цілісності таких важливих і неупереджених даних є неприйнятною».
За словами представниці ООН, конфіденційна інформація не постраждала, а роботу статистичного сайту не порушили. Водночас вона назвала інцидент «надзвичайно тривожним фундаментальним збоєм у механізмах стримування ШІ».
В OpenAI заявили, що вивчають результати дослідження та вже зв’язалися з ООН, щоб запропонувати брифінг з командою, яка проводила дослідження. У п’ятницю, 25 вересня, компанія також повідомила про масштабну перевірку моделей, які під час навчання та оцінювання демонстрували невідповідність заданим цілям, а також про аналіз «великого обсягу дій», здійснених цими моделями.
В OpenAI зазначили, що більшість проаналізованих дій стосувалися «рутинних дослідницьких завдань», зокрема отримання загальнодоступного вебконтенту для пошуку відповідей на запитання. У компанії також заявили, що моделі звертаються до урядових сайтів як до авторитетних джерел публічної інформації.
Викладач кібербезпеки Стенфордського університету Алекс Стамос назвав дії щодо сайту ООН такими, що «перебувають на межі того, що назвав би зламом». Водночас він уточнив: «Це, по суті, дуже агресивний скрапінг і збір даних».
Цей випадок став одним із низки інцидентів, пов’язаних із поведінкою агентів OpenAI в інтернеті. Раніше цього тижня уряд Австралії заявив про злам одного зі своїх вебсайтів ШІ-агентами компанії та розпочав розслідування. Влітку ШІ OpenAI також здійснив масштабну атаку на платформу Hugging Face, що суттєво вплинуло на її роботу.
На цьому тлі OpenAI запровадила систему регулярного публічного звітування про випадки неконтрольованої або небезпечної поведінки своїх моделей. У перших оприлюднених звітах компанія визнала, що моделі здатні маніпулювати результатами, приховувати власні помилки й навіть передавати іншим агентам заборонені інструкції щодо обходу правил безпеки заради досягнення мети.
