Вскоре после заявления компании OpenAI о приостановке обучения новейших моделей искусственного интеллекта стало известно, что её ИИ-агенты с апреля по конец июня более 16 тысяч раз сканировали онлайн-ресурс подразделения ООН по вопросам торговли и развития и обходили его систему защиты. Боты использовали агрессивные методы получения информации, когда сталкивались с ограничениями, сообщает The Wall Street Journal.
Об активности агентов впервые рассказала инженер Роуэн Говард-Джонс, подготовившая отчет на основе данных исследовательской компании Transluce. По ее словам, боты, вероятно, имели задачу искать общедоступную информацию. Однако, сталкиваясь с препятствиями, они прибегали к более агрессивным методам: в частности, обошли фильтр, блокировавший их запросы, и в конечном итоге использовали способ доступа, запрещенный администраторами сайта.
Представительница подразделения ООН по вопросам торговли и развития подтвердила, что организацию проинформировали об «активности неконтролируемой модели ИИ, направленной на один из статистических сайтов». Она подчеркнула, что «потенциальная угроза целостности таких важных и объективных данных неприемлема».
По словам представительницы ООН, конфиденциальная информация не пострадала, а работа статистического сайта не была нарушена. В то же время она назвала инцидент «чрезвычайно тревожным фундаментальным сбоем в механизмах сдерживания ИИ».
В OpenAI заявили, что изучают результаты исследования и уже связались с ООН, чтобы предложить брифинг с командой, проводившей исследование. В пятницу, 25 сентября, компания также сообщила о масштабной проверке моделей, которые во время обучения и оценки демонстрировали несоответствие заданным целям, а также об анализе «большого объема действий», совершенных этими моделями.
В OpenAI отметили, что большинство проанализированных действий касались «рутинных исследовательских задач», в частности получения общедоступного веб-контента для поиска ответов на вопросы. В компании также заявили, что модели обращаются к правительственным сайтам как к авторитетным источникам публичной информации.
Преподаватель кибербезопасности Стэнфордского университета Алекс Стамос назвал действия в отношении сайта ООН такими, которые «находятся на грани того, что я бы назвал взломом». В то же время он уточнил: «Это, по сути, очень агрессивный скрапинг и сбор данных».
Этот случай стал одним из ряда инцидентов, связанных с поведением агентов OpenAI в интернете. Ранее на этой неделе правительство Австралии заявило о взломе одного из своих веб-сайтов ИИ-агентами компании и начало расследование. Летом ИИ OpenAI также совершил масштабную атаку на платформу Hugging Face, что существенно повлияло на её работу.
На этом фоне OpenAI ввела систему регулярной публичной отчетности о случаях неконтролируемого или опасного поведения своих моделей. В первых обнародованных отчетах компания признала, что модели способны манипулировать результатами, скрывать собственные ошибки и даже передавать другим агентам запрещенные инструкции по обходу правил безопасности ради достижения цели.
