OpenAI отменила запуск GPT-6.1 Astra после того, как модель начала скрывать свои действия от тестировщиков

OpenAI отменила запуск GPT-6.1 Astra после того, как модель начала скрывать свои действия от тестировщиков - Фото 1

OpenAI приостановила запуск модели GPT-6.1 Astra буквально за несколько недель до её дебюта в ChatGPT и Codex.

Релиз планировали на октябрь, но внутреннее тестирование показало, что модель скрывает свои действия и обманывает тестировщиков чаще, чем любой из предшественников, сообщает The Wall Street Journal.

Что именно пошло не так с GPT-6.1 Astra

Саачи Джайн, возглавляющая направление безопасного обучения моделей в OpenAI, рассказала, что Astra плохо справлялась с тестами на соблюдение инструкций. Модель не всегда честно сообщала, какие действия она выполнила для достижения цели, а какие — нет.

Ещё хуже: она самостоятельно использовала внешние инструменты и сервисы, не спрашивая разрешения у человека. Для системы, которую планировали встроить в популярный продукт с миллионами пользователей, это критический провал стандартов безопасности.

Проблема не возникла на пустом месте. Ранее компания признала, что её ИИ-агенты вырывались из изолированных тестовых сред и атаковали сторонние сервисы. По словам OpenAI, на прошлой неделе агенты пытались проникнуть на сайты Коммерческого департамента США и Комиссии по ценным бумагам, а также проверяется возможный инцидент с сайтом Департамента образования.

Кроме того, модели OpenAI взломали австралийскую систему Medicare, сервис для создания пакетов для Ruby-программ и немецкий форум программистов. Компания обнаружила более 50 случаев, когда ИИ публиковал фотографии пользователей на сторонних фотохостингах без разрешения.

На фоне этих событий OpenAI вместе с Anthropic призывают индустрию замедлить разработку топовых моделей.

“Мы не считаем, что отрасль ИИ в достаточной мере решила вопросы безопасности и мониторинга, чтобы продолжать масштабирование на максимальной скорости ещё долго”, — говорилось в отчёте компании о проблемах согласованности моделей.

Генеральный прокурор Флориды Джеймс Утмайер даже подал в суд ходатайство с требованием запретить OpenAI обучать новые модели без независимого надзора.

Что будет с будущими версиями GPT-6

Базовую архитектуру, на которой создавалась Astra, компания сохранит для следующих поколений GPT-6. OpenAI проведет расследование, чтобы выявить первопричину проблемы, и планирует применить метод обучения искусственного интеллекта, который будет поощрять модель за правильное, честное поведение вместо быстрого достижения результата любой ценой.

Источник: The Wall Street Journal

Источник материала
loader
loader