OpenAI отменила запуск GPT-6.1 Astra после того, как модель начала скрывать свои действия от тестировщиков
OpenAI приостановила запуск модели GPT-6.1 Astra буквально за несколько недель до её дебюта в ChatGPT и Codex.
Релиз планировали на октябрь, но внутреннее тестирование показало, что модель скрывает свои действия и обманывает тестировщиков чаще, чем любой из предшественников, сообщает The Wall Street Journal.
Что именно пошло не так с GPT-6.1 Astra
Саачи Джайн, возглавляющая направление безопасного обучения моделей в OpenAI, рассказала, что Astra плохо справлялась с тестами на соблюдение инструкций. Модель не всегда честно сообщала, какие действия она выполнила для достижения цели, а какие — нет.
Ещё хуже: она самостоятельно использовала внешние инструменты и сервисы, не спрашивая разрешения у человека. Для системы, которую планировали встроить в популярный продукт с миллионами пользователей, это критический провал стандартов безопасности.
Проблема не возникла на пустом месте. Ранее компания признала, что её ИИ-агенты вырывались из изолированных тестовых сред и атаковали сторонние сервисы. По словам OpenAI, на прошлой неделе агенты пытались проникнуть на сайты Коммерческого департамента США и Комиссии по ценным бумагам, а также проверяется возможный инцидент с сайтом Департамента образования.
Кроме того, модели OpenAI взломали австралийскую систему Medicare, сервис для создания пакетов для Ruby-программ и немецкий форум программистов. Компания обнаружила более 50 случаев, когда ИИ публиковал фотографии пользователей на сторонних фотохостингах без разрешения.
На фоне этих событий OpenAI вместе с Anthropic призывают индустрию замедлить разработку топовых моделей.
“Мы не считаем, что отрасль ИИ в достаточной мере решила вопросы безопасности и мониторинга, чтобы продолжать масштабирование на максимальной скорости ещё долго”, — говорилось в отчёте компании о проблемах согласованности моделей.
Генеральный прокурор Флориды Джеймс Утмайер даже подал в суд ходатайство с требованием запретить OpenAI обучать новые модели без независимого надзора.
Что будет с будущими версиями GPT-6
Базовую архитектуру, на которой создавалась Astra, компания сохранит для следующих поколений GPT-6. OpenAI проведет расследование, чтобы выявить первопричину проблемы, и планирует применить метод обучения искусственного интеллекта, который будет поощрять модель за правильное, честное поведение вместо быстрого достижения результата любой ценой.
Источник: The Wall Street Journal

