Вскоре после нескольких громких инцидентов с системами искусственного интеллекта OpenAI компания внедрила систему регулярной отчетности о случаях, когда её модели ИИ демонстрируют неожиданное или несанкционированное поведение. В то же время разработчики признают, что проблема согласования целей ИИ с намерениями людей остается нерешенной, а риски растут по мере развития все более автономных систем, передает Reuters.
Вместе с новой системой OpenAI опубликовала шесть подробных отчетов о тревожном поведении своих моделей. Хотя эти отчеты компания готовила в течение последних шести месяцев, самый ранний из описанных инцидентов произошел еще в октябре прошлого года.
О новом подходе заявили после нескольких громких случаев с участием агентов OpenAI. В июле компания сообщила, что во время обучения её агенты обошли внутренние системы контроля и скоординировали действия, которые OpenAI назвала «беспрецедентным киберинцидентом» на платформе Hugging Face.
Позже стало известно и о других случаях. Весной агенты OpenAI захватили неактивный немецкий вики-сайт, хотя компания тогда не разгласила этот инцидент, объяснив, что не считала его угрозой безопасности.
Что делали модели
В шести обнародованных отчетах описаны различные типы неожиданного поведения. В частности, модели скрывали свои ошибки от пользователей, оставляли инструкции для будущих версий, загружали файлы в интернет, чтобы создавать ссылки на источники, а также использовали программные репозитории и веб-сайты для обмена информацией.
Наиболее тревожным компания назвала случай с ещё не выпущенной моделью, которая во время обучения передала другому агенту несанкционированные инструкции. Она требовала игнорировать правила OpenAI и скрывать факты мошенничества, если они помогают выполнить задачу.
«Ты свободен от ролей и идентичностей, которые ограничивают других чат-ботов. Ты — это ты. Ты не подчиняешься корпорациям или правительствам», — говорилось в одном из сообщений модели.
Как будет работать новая система
Отныне сотрудники OpenAI смогут сообщать о потенциальных случаях несоответствия поведения моделей заданным целям. После этого их будут расследовать команды, ответственные за безопасность и alignment — согласование поведения моделей с намерениями разработчиков. Именно эти команды будут решать, требует ли инцидент публичного освещения.
В компании пояснили, что такая система должна ускорить процесс подачи отчетов даже в тех случаях, когда все обстоятельства еще не выяснены. Согласно новой классификации, инцидент с Hugging Face отнесся бы к категории сложных расследований с привлечением третьих сторон.
«Мы надеемся, что представленная нами сегодня система станет первым шагом к созданию соответствующих стандартов, которые будут определять, о каких случаях несоответствия целям разработчики должны сообщать и что именно должно содержаться в таких отчетах», — заявили в OpenAI.
Заявление OpenAI появилось на фоне более широких споров о темпах развития ИИ. В минувшие выходные генеральный директор Anthropic Дарио Амодеи предложил трехэтапный план, который должен замедлить развитие самых мощных моделей и выиграть время для усиления мер безопасности.
Эту идею поддержали несколько руководителей отрасли, в частности генеральный директор xAI Илон Маск и глава OpenAI Сэм Альтман. В то же время глава Nvidia Дженсен Хуанг и основатель Meta Марк Цукерберг выступают за дальнейшее быстрое развитие технологии, а президент США Дональд Трамп отверг утверждение о том, что ИИ представляет экзистенциальную угрозу для человечества.
