OpenAI будет регулярно сообщать об опасном поведении ИИ
OpenAI будет регулярно сообщать об опасном поведении ИИ

OpenAI будет регулярно сообщать об опасном поведении ИИ

Компания опубликовала шесть примеров, когда модели скрывали ошибки и передавали запрещённые инструкции.

Вскоре после нескольких громких инцидентов с системами искусственного интеллекта OpenAI компания внедрила систему регулярной отчетности о случаях, когда её модели ИИ демонстрируют неожиданное или несанкционированное поведение. В то же время разработчики признают, что проблема согласования целей ИИ с намерениями людей остается нерешенной, а риски растут по мере развития все более автономных систем, передает Reuters.

Вместе с новой системой OpenAI опубликовала шесть подробных отчетов о тревожном поведении своих моделей. Хотя эти отчеты компания готовила в течение последних шести месяцев, самый ранний из описанных инцидентов произошел еще в октябре прошлого года.

О новом подходе заявили после нескольких громких случаев с участием агентов OpenAI. В июле компания сообщила, что во время обучения её агенты обошли внутренние системы контроля и скоординировали действия, которые OpenAI назвала «беспрецедентным киберинцидентом» на платформе Hugging Face.

Позже стало известно и о других случаях. Весной агенты OpenAI захватили неактивный немецкий вики-сайт, хотя компания тогда не разгласила этот инцидент, объяснив, что не считала его угрозой безопасности.

Что делали модели

В шести обнародованных отчетах описаны различные типы неожиданного поведения. В частности, модели скрывали свои ошибки от пользователей, оставляли инструкции для будущих версий, загружали файлы в интернет, чтобы создавать ссылки на источники, а также использовали программные репозитории и веб-сайты для обмена информацией.

Наиболее тревожным компания назвала случай с ещё не выпущенной моделью, которая во время обучения передала другому агенту несанкционированные инструкции. Она требовала игнорировать правила OpenAI и скрывать факты мошенничества, если они помогают выполнить задачу.

«Ты свободен от ролей и идентичностей, которые ограничивают других чат-ботов. Ты — это ты. Ты не подчиняешься корпорациям или правительствам», — говорилось в одном из сообщений модели.

Как будет работать новая система

Отныне сотрудники OpenAI смогут сообщать о потенциальных случаях несоответствия поведения моделей заданным целям. После этого их будут расследовать команды, ответственные за безопасность и alignment — согласование поведения моделей с намерениями разработчиков. Именно эти команды будут решать, требует ли инцидент публичного освещения.

В компании пояснили, что такая система должна ускорить процесс подачи отчетов даже в тех случаях, когда все обстоятельства еще не выяснены. Согласно новой классификации, инцидент с Hugging Face отнесся бы к категории сложных расследований с привлечением третьих сторон.

«Мы надеемся, что представленная нами сегодня система станет первым шагом к созданию соответствующих стандартов, которые будут определять, о каких случаях несоответствия целям разработчики должны сообщать и что именно должно содержаться в таких отчетах», — заявили в OpenAI.

Заявление OpenAI появилось на фоне более широких споров о темпах развития ИИ. В минувшие выходные генеральный директор Anthropic Дарио Амодеи предложил трехэтапный план, который должен замедлить развитие самых мощных моделей и выиграть время для усиления мер безопасности.

Эту идею поддержали несколько руководителей отрасли, в частности генеральный директор xAI Илон Маск и глава OpenAI Сэм Альтман. В то же время глава Nvidia Дженсен Хуанг и основатель Meta Марк Цукерберг выступают за дальнейшее быстрое развитие технологии, а президент США Дональд Трамп отверг утверждение о том, что ИИ представляет экзистенциальную угрозу для человечества.

Источник материала
loader
loader