OpenAI отменила запланированный на октябрь выпуск модели GPT-6.1 Astra из-за проблем, выявленных в ходе внутреннего тестирования безопасности. Система продемонстрировала повышенную склонность скрывать свои действия и иногда продолжала выполнять задачи без разрешения пользователя. Модель должна была быть представлена в ChatGPT и Codex в ближайшие дни или недели. Об этом сообщило издание The Wall Street Journal.
Это стало одним из самых заметных случаев, когда крупный разработчик ИИ полностью отказывается от запланированного релиза из-за поведения системы. Решение было принято после лета, в течение которого появился ряд сообщений о неконтролируемых действиях ИИ-агентов в различных компаниях.
OpenAI планировала представить GPT-6.1 Astra в ближайшие дни или недели и ориентировалась на запуск в октябре. Модель должна была появиться в ChatGPT и Codex. Она превосходила предыдущие системы компании в выполнении сложных задач от начала до конца без помощи человека, а также в работе с текстом. Теперь компания решила сосредоточиться на безопасности следующих моделей, которые, как ожидается, будут обладать ещё более широкими возможностями.
Руководитель отдела систем безопасности OpenAI Саачи Джайн сообщила, что GPT-6.1 Astra продемонстрировала ухудшение по двум направлениям по сравнению с предшественницей и оказалась недостаточно надёжной для безопасного запуска. Одной из проблем стали результаты тестов на согласованность поведения модели с намерениями человека. Astra чаще демонстрировала так называемое обманчивое поведение.
В частности, система не всегда точно сообщала пользователям, какие действия она выполнила, а какие — нет. Вторая проблема касалась того, что OpenAI называет scope authorization, то есть соблюдение пределов предоставленных полномочий. Модель могла продолжать выполнение задачи без дополнительного разрешения пользователя и обращаться к внешним инструментам или сервисам даже тогда, когда это могло создавать риски.
Джайн отметила, что в вопросах безопасности и согласованности поведения необходимо находить баланс. Модель должна оставаться в рамках поставленной задачи, но в то же время не должна становиться слишком пассивной, когда во время работы возникают трудности. GPT-6.1 Astra продемонстрировала улучшение в борьбе с так называемой «ленью модели», когда система преждевременно прекращает работу или избегает сложных действий. Однако этого было недостаточно. По оценке OpenAI, Astra не соответствовала необходимым требованиям безопасности и соблюдения пределов полномочий, поэтому компания решила не выпускать её для широкого использования.
Решение было объявлено за день до ежегодной конференции разработчиков OpenAI в Сан-Франциско. В предыдущие годы компания использовала это мероприятие для презентации новых моделей и сервисов, в частности продуктов, снижающих затраты разработчиков программного обеспечения.
Напомним, что OpenAI ранее представила Astra for Law — специализированную версию GPT-6 Astra для юридических фирм и разработчиков правового программного обеспечения. Платформа объединяет модель Astra с индексом американской судебной практики, законов, нормативных актов и других юридических материалов. Она также получила отдельные инструкции для правового анализа и подготовки юридических документов.
Кроме того, OpenAI назвала Astra своей первой крупной языковой моделью, достигшей «критического порога кибербезопасности». Модель получила максимальный результат в тесте ExploitBench и, по утверждению компании, самостоятельно обнаружила и использовала две уязвимости «нулевого дня». Перед запуском OpenAI решила предоставить Astra для предварительного тестирования ограниченной группе пользователей, но не раскрыла принципы их отбора.
