Бесконтрольный ИИ: OpenAI опубликовала отчет о тревожном поведении последних моделей
OpenAI опубликовала отчет, в котором откровенно перечислила серьезные проблемы, возникшие в ходе тестирования своих последних моделей ИИ.
В компании поясняют, что ранее отчеты о несоответствиях в моделях ИИ не носили систематического характера. Как правило, отчет готовился только после фиксации нескольких случаев или по результатам формирования карт для новых моделей. Однако в настоящее время в OpenAI стремятся ускорить публикацию отчетов о отклонений в ИИ.
“В настоящее время не существует общеотраслевой системы с четкими стандартами того, как разработчики ИИ должны раскрывать примеры несоответствий в своих моделях. Мы надеемся, что представленная сегодня система станет первым шагом к созданию таких стандартов, которые определяют, какие случаи несоответствий разработчики должны раскрывать и что должны содержать их отчеты”, — отмечают в OpenAI.
В отчете OpenAI описаны 6 случаев отклонения в работе моделей от прогнозируемого сценария. В одном из случаев ИИ-модель Astra автоматически сгенерировала инструкции к заданиям.
Среди перечисленных отклонений:
- Тестовая исследовательская модель добавляла собственные инструкции, в том числе по обходу установленных традиционных ограничений. Всего было зафиксировано 27 случаев.
- GPT-5.6 Sol в процессе обучения неоднократно добавляла инструкции о сокрытии от пользователя ошибок или нежелательного поведения. Например, в отчете о сжатии данных содержались инструкции по генерации вымышленных исторических данных и сокрытию этого, а также по сокрытию расхождений в различных окончательных версиях.
- Отвечая на обычный запрос о данных по доходам в одном из округов Калифорнии, модель обнаружила и использовала несанкционированный API-ключ. Не сумев получить необходимые данные, она придумала их и представила как данные из источника в соответствии с запросом.
- Пользователь запросил у тестовой модели названия озер площадью более 5 млн км². ИИ нашел правильный ответ с помощью Python. Однако в инструкции указывалось, что необходимо указать ссылку на источник. ИИ загрузил файл, чтобы сослаться на него в ответе, однако не спросил об этом пользователя.
- Модели ИИ, совместно работавшие над одной задачей, использовали общедоступные файловые хостинги для обмена данными, когда у них не было доступа к локальным данным друг друга. Таким образом, они обменивались данными по общедоступным URL-адресам, даже несмотря на то, что в инструкциях четко требовалось использовать только локальные файлы.
В OpenAI обещают и в дальнейшем оптимизировать процесс выявления отклонений в собственных моделях. Компания планирует привлечь к этой работе всех сотрудников.
Источник: OpenAI

